Italian Tech

Intelligenza Artificiale

Veo 3 di Google ora trasforma una foto in un video completo, con suoni. Ecco come funziona

Veo 3 di Google ora trasforma una foto in un video completo, con suoni. Ecco come funziona

Google amplia le capacità della sua intelligenza artificiale Veo 3, integrando video e audio generati da una singola foto. Una funzione inedita che unisce immagine, movimento e suono in un’unica operazione

1 minuti di lettura

Google ha introdotto una nuova funzione all’interno della sua app Gemini: la possibilità di generare un breve video partendo da una singola fotografia.

La particolarità di questa novità risiede nel fatto che il video non solo anima l’immagine, ma include anche una traccia audio generata automaticamente, con suoni ambientali, effetti e persino dialoghi.

La tecnologia alla base di questa nuova funzione è Veo 3, la terza generazione del modello sviluppato da Google DeepMind per la creazione di video a partire da testo o immagini.

Che cos’è Veo 3

Presentato a maggio scorso, Veo 3 è in grado di produrre clip video della durata di circa otto secondi, in risoluzione 720p, combinando movimento e suono in un’unica generazione.

Veo 3 è disponibile per gli utenti abbonati ai piani Pro e Ultra di Gemini, in oltre 150 Paesi. La funzione che permette di animare le fotografie è in fase di rilascio e dovrebbe apparire in Gemini nei prossimi giorni.

Attualmente la funzione è disponibile nella versione web dell'app Gemini, ma Google prevede di estenderla presto anche ai dispositivi mobili.

Come si fa a trasformare una foto in video

Il processo è semplice: si accede a Gemini (è necessario un account Google e un abbonamento Pro o Ultra), si carica una foto e si descrive brevemente cosa dovrebbe accadere, compreso il tipo di audio che si vuole abbinare. A quel punto il sistema impiega un tempo breve per restituire un video animato, completo di suono.

Questo tipo di integrazione rappresenta un passo in avanti rispetto a ciò che consentono altri modelli presenti sul mercato, come Runway Gen?2, Pika Labs o Sora di OpenAI.

Tutti questi chatbot possono generare video partendo da testo o immagini, ma senza audio nativo. In quei casi, la colonna sonora deve essere aggiunta in un secondo momento, separatamente.

Un aspetto rilevante del sistema di Google è la presenza di meccanismi di sicurezza integrati: tutti i video sono marcati con un watermark - la scritta “Veo”, visibile in basso a destra, e uno invisibile (SynthID) - per garantire la tracciabilità e contrastare un uso improprio dei contenuti generati.