Fermi un attimo. Da quando Beppe Grillo parla il cinese? No, il comico - nonché fondatore del Movimento 5 Stelle - non ha fatto un corso accelerato.
Il video diventato virale negli ultimi giorni, in cui Grillo si esprime alla perfezione in cinese, è vero fino a un certo punto. È stato autorizzato dal comico e realizzato grazie al suo aiuto, ma non corrisponde alla realtà: le espressioni facciali di Grillo e la sua voce sono il frutto, infatti, “della combinazione di intelligenze artificiali che svolgono compiti differenti”.
Ce lo racconta Nicola Grandis, amministratore delegato dell’azienda Asc27 che ha realizzato la clip. Asc27 è stata fondata nel 2020 - ha 20 dipendenti - e ha sedi a Milano, Roma, Cieti e Bologna, più una rappresentanza commerciale a San Paolo del Brasile. “Siamo maniscalchi dell’intelligenza artificiale” dice Grandis, stemperando con un pizzico di poesia il lavoro degli algoritmi. “Quello che facciamo, in pratica, è arricchire e trasformare l’informazione attraverso l’AI”.
E nel caso di Grillo come siete riusciti a ottenere un risultato così credibile?
Siamo partiti dal riprendere Grillo con uno smartphone, catturando alcuni minuti di movenze, smorfie, espressioni, abbigliamento e postura. Successivamente abbiamo acquisito la sua voce - un discorso libero per alcuni minuti - al fine di campionare il tono, l’espressività, e altri parametri del suo parlato. In questo modo abbiamo costruito un avatar, ovvero una riproduzione del soggetto parlante e in movimento. Infine abbiamo affidato il testo che ci ha fornito Grillo a modelli di AI che lo hanno tradotto in cinese e che poi hanno generato l’audio che avete ascoltato.
Intorno a questa voce è stato attivato il modello di generazione video che ha creato una successione di immagini compatibili con l’audio, sia per quel che riguarda i movimenti del soggetto, sia per quel che concerne il suo labiale, oltre ad altri parametri più sottili che danno l’effetto del realismo al contenuto generato. Infine, alcuni modelli di CleanUp e WrapUP si sono occupati di rendere tutto ancora più fluido, luminoso e realistico con tecniche e tecnologie mutuate dal gaming.
Il risultato è l’avatar di Beppe Grillo che parla una lingua che non conosce, ma con le sue espressioni, le sue movenze e la sua voce.
Grillo parla in cinese (grazie all'IA): "Dopo la Via della Seta, quella del basilico"
Il video di Grillo che parla in cinese appare come un "gioco". E il personaggio si presta a una provocazione tecnologica come questa. Ma in futuro quali saranno le applicazioni positive di clip come questa? Chi ne ha bisogno e perché saranno richieste?
Ci sono vari contesti dove un avatar umano con una voce familiare/nota può risultare più appetibile o interessante rispetto ad un pupazzo poligonale con voce metallica. Ma il confronto non va inteso come “persona reale” vs “avatar”. Piuttosto va pensato in un contesto in cui sarebbe impossibile utilizzare la persona reale ed è quindi necessario ricorrere ad un avatar. Beppe Grillo non parla il cinese, dunque non esiste un’altra soluzione per realizzare il suo video diventato virale.
Sono molti e variegati i contesti in cui si verifica questa condizione di “impossibilità”, basti pensare ad un professore che nel futuro volesse creare contenuti o lezioni personalizzate per ogni singolo alunno del suo corso, piuttosto che a rapporti medici a distanza in cui va illustrato un referto a pazienti mai incontrati prima. L’unico limite è la fantasia. Come ogni tecnologia innovativa, saranno i bisogni a definire applicabilità e perimetro.
Quali altri esperimenti di questo tipo avete fatto recentemente?
Stiamo lavorando ad una tecnologia di avatarizzazione degli oggetti e dei sentimenti manifestati. Il progetto, con poca fantasia, ha il nome interno di Synesthesia, ma è ancora riservato, non possiamo divulgare dettagli.
Attualmente è più semplice replicare una voce o un volto?
Per quanto controintuitivo, e certamente non comune tra le startup mono-prodotto, per noi di ASC27 non c’è alcuna differenza. Si tratta in entrambi i casi di sintetizzazione di informazione.
Così come questi avatar vengono creati, è possibile riconoscerli grazie all'AI? Stabilire insomma con certezza se ci troviamo di fronte a dei falsi?
Molti sono stati i tentativi di costruzione di un Fake-Detector universale, tutti risibili e fallimentari. Quando l’avatar di Grillo è comparso, molti utenti e molti giornalisti non hanno realizzato subito che fosse sintetico, e dove falliscono gli umani, l’AI non può vincere su singolo compito. Ciò per dire che esistono diverse tecniche alternative per assegnare uno score - una probabilità insomma - a un contenuto che ne misuri la genuinità.
Ma poi è necessario valutare il contesto. In ambito audio/video si cercano artefatti, glitch, imperfezioni schematiche e ricorrenti in frequenza, tuttavia ci sono persone che naturalmente scrivono male, possono parlare in modo un po’ robotico e cadenzato o avere dei comportamenti o gestualità strambi nel discorso. Possiamo dire che in funzione del contesto, appunto, le tecniche si modificano e cambia la precisione con cui si può sperare di rilevare un deepfake.
Come potremo stabilire, in futuro, se avremo di fronte un avatar o un'intelligenza artificiale? Come sarà possibile garantire l'autenticità dell'uomo in un mondo dove tutti (o quasi) potranno creare un perfetto alter ego digitale?
Servirà etica e serviranno regole. Un mio amico teologo ha riportato una definizione dell’etica di quasi un secolo fa “the obedience to the unenforceable” (J.F. Mouton), ovvero la nostra spinta ad aiutare una vecchietta in difficoltà ad attraversare la strada anche quando non vi sia una legge che lo impone. Dove non giungeremo con l’etica, occorreranno regole, leggi, norme e pene per chi non le rispetta. Oppure, potrebbe finire come il Covid, diventare endemico, e ciò che oggi ci sconvolge e ci tormenta diventerà parte integrante delle nostre esistenze, un po’ come deve essere capitato al venditore di cavalli che si trovava di fronte la fabbrica della Ford Model-T e che l’ha vista uscire su strada.
Anche voi, come molte aziende nel mondo, sviluppate intelligenza artificiale. Siete tra quelli preoccupati che un giorno l'AI sfuggirà al controllo umano?
L’AI è un game-changer, ma come ne abbiamo avuti tanti. Se ragni e blatte hanno resistito a noi senza estinguersi e senza quasi evolversi, noi faremo lo stesso con l’AI. Ironia a parte, l’AI è una tecnologia, figlia di una scienza, parente stretta del cambiamento. L’AI è soltanto l’ultimo seme di Alan Turing e di tutti i logici e i matematici che abbiamo avuto prima di lui, innaffiata da Claude Shannon e rimasta in forno per un po’ a cuocere. Adesso inizia ad essere commestibile, appetibile per alcuni.
Il bello dell’AI lo dobbiamo certamente ancora vedere, e prepariamoci anche a qualche effetto collaterale indesiderato. Ci adatteremo al suo utilizzo ed a convivere con lei, così come abbiamo fatto con le calcolatrici un secolo fa, calcolatrici che non ci hanno fatto dimenticare la matematica. L’AI può trasformare informazioni, per tutto il resto serve l’uomo, dunque non ci sfuggirà mai di mano, al massimo ci saranno uomini che vorranno praticarne utilizzi perniciosi ed altri uomini che vigileranno su questo.