Italian Tech

IA

Google ha rotto il silenzio dell’intelligenza artificiale

Google ha rotto il silenzio dell’intelligenza artificiale

Il nuovo modello di intelligenza artificiale di Google DeepMind è capace di creare in pochi istanti, a partire da una descrizione testuale, video realistici che per la prima volta - nell’epoca dell’IA generativa - sono accompagnati da un audio sincronizzato. Distinguere i deepfake è sempre più difficile

3 minuti di lettura

Google DeepMind ha rilasciato da alcuni giorni Veo 3, un nuovo modello di intelligenza artificiale capace di generare video ultra-realistici partendo da semplici descrizioni testuali.

Ma la vera novità è un’altra: per la prima volta, nell’era dell’IA generativa, questi filmati sono accompagnati da un audio sincronizzato che include dialoghi, effetti sonori e rumori ambientali.

Come il passaggio dal muto al sonoro rivoluzionò il cinema negli anni ’20, così Veo 3 promette di trasformare la narrazione visiva generata dall’intelligenza artificiale.

Finora, i modelli text-to-video riuscivano a produrre clip brevi e visivamente credibili, ma senza suono. Ora quel limite è stato superato.

Cos’è Veo 3

Sviluppato da Google DeepMind, Veo 3 è un potente modello text-to-video in grado di convertire prompt testuali – a breve anche immagini statiche – in video realistici fino a 8 secondi, con risoluzione fino a 4K e audio generato insieme alle immagini.

Le persone, gli animali e gli oggetti presenti nei video si muovono in modo naturale, grazie a una simulazione della fisica del mondo reale, e le labbra si muovono in accordo (quasi sempre perfetto) con le parole pronunciate.

Il risultato? Clip che sembrano girate da una troupe cinematografica, ma create interamente dall’IA.

Chi può usarlo

Attualmente, Veo 3 è disponibile solo attraverso Gemini, il chatbot di Google, accessibile via gemini.google.com o tramite l’app ufficiale per iOS e Android. L’accesso è però riservato agli utenti del piano Ultra (249 dollari al mese), disponibile per ora solo negli Stati Uniti (e in preview per chi, come noi, ha bisogno di testarlo per raccontarlo ai lettori).

Tuttavia Veo 3 gestisce l’italiano sorprendentemente bene: capisce i prompt, ma su questo non avevamo dubbi, e interpreta i dialoghi motlo bene, arrivando a generare un audio credibile nella nostra lingua.

I nostri test con Veo 3

Abbiamo messo alla prova Veo 3 con prompt surreali che hanno comunque dato come risultato video realistici.

In un esperimento, abbiamo chiesto all’IA di creare un finto TG1 in cui una giornalista annunciava, con tono serio, che l’intelligenza artificiale generale (AGI) aveva finalmente risolto “il problema del traffico, dei parcheggi e delle buche di Roma”.

Il video finale, di 8 secondi, è convincente: la voce è naturale, il labiale sincronizzato alla perfezione e lo stile visivo imita in modo credibile l’annuncio di una breaking news.

In un altro test, abbiamo simulato un dialogo tra due podcaster: “Arriveremo all’AGI?”, chiede uno. “Sì, ma ci arriveremo agi...tati”, risponde l’altro.

Il tono, il respiro, la mimica: tutto è coerente, tutto sembra reale e corrisponde alle indicazioni scherzose che abbiamo offerto alla macchina.

La forza di Veo 3 sta proprio qui: riesce a dare vita a scene con dialoghi precisi, animazioni fluide e una resa audiovisiva di alto livello, senza alcuna necessità di videoediting o animazione manuale. Serve solo un buon prompt. E magari una conoscenza di base del linguaggio cinematografico per ottenere risultati eccellenti.

Cosa rende Veo 3 così speciale?

Nel panorama in rapida evoluzione dei generatori video, Veo 3 si distingue da concorrenti come Sora di OpenAI o Runway grazie all’audio: non solo sincronizzato, ma interamente prodotto a partire dal prompt.

Ad esempio se si descrive una scena d’inseguimento sotto la pioggia, Veo 3 non solo genera le auto in corsa e gli schizzi d’acqua, ma aggiunge il suono realistico della pioggia, dei clacson, del motore. L’effetto immersivo è totale. Nessun altro modello, al momento, raggiunge questa coerenza tra suono e immagine.

Opportunità (e rischi)

Veo 3 apre scenari straordinari per la creazione di contenuti.

Registi indipendenti possono produrre scene complesse senza budget milionari; docenti e divulgatori possono creare video immersivi per spiegare la storia o la scienza; artisti, pubblicitari e comunicatori possono realizzare in pochi minuti progetti visivi prima impensabili.

Ma c’è anche il rovescio della medaglia: i deepfake. Il realismo estremo di questi video accresce la preoccupazione per le potenziali truffe e la disinformazione che potrebbe veicolare questa tecnologia.

Un video generato con Veo 3 potrebbe far sembrare che una persona abbia detto qualcosa che in realtà non ha mai pronunciato. La linea tra realtà e finzione, da questo punto di vista, sta diventando sempre più sottile.

È successo anche a noi, con il finto TG1: per quanto l’etichetta “Rai” non fosse identica all’originale, il contesto, il tono e il labiale perfetto sono così convincenti da risultare credibili a un osservatore poco attento che si imbatte in un video simile sui social.

Un aspetto critico, infine, è l'assenza di qualsiasi watermark o segno distintivo nei video prodotti da Veo 3: nulla indica che siano stati generati da un'intelligenza artificiale, rendendoli potenzialmente indistinguibili da riprese reali.