Gemini Omni è un modello che Google presenta come il punto d’incontro tra la capacità di ragionamento di Gemini - il modello di IA più avanzato sviluppato da Big G - e la generazione di media.
La formula usata da Google è questa: può “creare qualsiasi cosa da qualsiasi input”, cioè produrre contenuti di ogni genere a partire da testo, immagini, video e anche audio. Il focus iniziale, per ora, è sulla generazione di video.
Gemini rappresenta per l’azienda di Mountain View un passo in avanti verso un “world model”, cioè un sistema che non si limita a produrre contenuti, ma prova anche a simulare e comprendere aspetti del mondo fisico.
Come funziona, in termini semplici
Invece di partire da un solo prompt testuale, Omni lavora su una combinazione di materiali. L’utente può dargli una descrizione scritta, un’immagine di riferimento, una clip video, un file audio o più elementi insieme. Il modello analizza questi input in modo nativo, cioè senza trattarli come pezzi separati, e usa la conoscenza del mondo di Gemini per costruire un risultato coerente.
Per differenziarlo dal modello precedente, Veo, il primo ad aver permesso di generare video realistici con audio sincronizzato, Google insiste sul fatto che Omni non si limita a produrre immagini in movimento, ma prova a collegare fisica intuitiva, contesto culturale, conoscenza storica e logica della scena. Lavora in pratica in modo simile a Nano Bana, il popolare modello per la generazione di immagini dell’azienda di Mountain View.
È il motivo per cui DeepMind, il team di Google che lavora sull’intelligenza artificiale di frontiera, descrive il modello come capace di passare dal semplice fotorealismo a uno storytelling più significativo. In altre parole, il sistema promette di capire non solo che cosa condivide un utente, ma anche come quel materiale può essere trasformato in una scena credibile o narrativamente sensata.
In un esempio mostrato sul palco del Google I/O, l’evento che si è svolto a Mountain View attraverso cui Big G ha mostrato le sue innovazioni nel campo dell’IA, una struttura metallica ripresa in un video viene modificata fino a sembrare fatta di bolle. Questo aiuta a capire la direzione del prodotto: più che un generatore lineare, Omni punta a essere un sistema di manipolazione audiovisiva guidato dal linguaggio naturale.
Il ruolo della conversazione nell’editing
Gemini Omni non viene presentato come un generatore “one shot”, cioè da prompt singolo e risultato finale. Google lo presenta come uno strumento di editing conversazionale. Significa che dopo una prima generazione si può continuare a parlare con il modello per cambiare inquadrature, atmosfera, dialoghi o altri elementi della scena. L’editing, tuttavia, non è una novità: molti strumenti basati su IA consentono modifiche con linguaggio naturale.
Si tratta di un approccio che sposta l’esperienza più vicino a un dialogo che a un software di montaggio classico. Non si deve per forza impostare tutto all’inizio con precisione estrema. DeepMind, nella guida ai prompt di Gemini Omni, suggerisce anzi che l’utente può indicare l’effetto desiderato - per esempio realistico o cinematografico - lasciando al modello il compito di risolvere molti dettagli intermedi.
Perché Google lo considera diverso dagli strumenti precedenti
Negli ultimi anni i modelli generativi sono stati divisi in categorie abbastanza separate: chatbot, generatori di immagini, sistemi video, modelli vocali. Gemini Omni prova a fondere queste famiglie in un unico flusso di lavoro creativo. L’idea è che il ragionamento e la generazione non siano più due fasi distinte, ma due capacità dello stesso sistema.
La differenza rispetto a un tradizionale prompt-to-video è che un modello più vecchio prova a rendere reale una scena descritta dall’utente. In Omni, almeno secondo Google, il modello usa conoscenza del mondo reale e comprensione multimodale per colmare i vuoti, interpretare meglio l’intenzione dell’utente e mantenere più coerenza fra gli elementi in ingresso.
Che cosa produce, concretamente
Il modello alla base di Omni, in questo momento, è Gemini Omni Flash: accetta input di testo, immagini, audio e video e produce video ad alta risoluzione con audio. Di massimo dieci secondi.
Google collega Omni anche a Flow, la sua piattaforma per la creazione video assistita dall’AI. L’azienda ha annunciato in occasione del Google I/O nuove funzioni proprio per Google Flow e Flow Music, includendo Gemini Omni come parte dell’evoluzione di questi strumenti.
Dove si usa e chi può provarlo
Gemini Omni è in fase di rollout per gli abbonati ai piani Google AI e viene integrato in esperienze come Gemini e Google Flow. DeepMind indica anche che gli utenti possono provarlo in Gemini e in Google Flow, mentre la pagina dedicata ai piani Google AI parla di distribuzione globale per gli abbonati.
Questo vuol dire che, almeno per ora, non sembra essere un modello aperto indistintamente a tutti come una funzione base dell’ecosistema Google. Fa parte del pacchetto premium con cui Google sta cercando di trasformare Gemini da semplice assistente a piattaforma creativa e operativa più ampia.