Il Venerdì

La bora a Trieste, foto creata con Midjourney
La bora a Trieste, foto creata con Midjourney 

Foto e video da non credere. Le Ai oltre ChatGpt

Non ci sono solo i testi creati dall’algoritmo di OpenAi. Altri software come Midjourney fanno la stessa cosa con le immagini e ora stanno per arrivare i video grazie ad una startup di nome Runway. Rischi (enormi) di manipolazione e opportunità creative di un mondo che è solo all’inizio

4 minuti di lettura

Il papa con il piumino bianco, quella foto virale manipolata con l'Intelligenza Artificiale, è solo un assaggio di quanto accadrà in futuro. Pablo Xavier, operaio edile di Chicago, l'ha creata usando il software Midjourney senza alcuna conoscenza tecnica. È una sorta di ChatGPT ma specializzato nelle immagini, al pari di Dall-E 2 della stessa OpenAi o ancora Stable Diffusion. Semplici da usare, anche se meno di ChatGPT, basta digitare una descrizione per ottenere dei risultati mai fedeli a quanto immaginato ma comunque credibili: uno scatto in bianco e nero del cantante argentino Carlos Gardel, morto nel 1935, che si esibisce nel Colosseo di Roma in un concerto mai avvenuto; una veduta che William Turner non ha mai dipinto; l'istantanea posticcia di una rivolta di piazza, dell'arresto di un politico come Donald Trump, della presa di una città in Ucraina. 

Un assaggio, dicevamo. Le intelligenze artificiali generative, dai testi alle immagini stanno approdando ai video e il modo di narrare e di narrarsi online potrebbe cambiare al di là del pericolo, anzi della certezza, di costanti manipolazioni e meme virali fuori controllo. Il web, del resto, è fatto per oltre il settanta per cento da filmati. Pensate quindi a cosa accadrà su Instagram, TikTok e YouTube, dove ogni giorno vengono pubblicati poco meno di quattro milioni di video.  

"Stiamo costruendo strumenti con i quali sarà possibile creare interi lungometraggi e "storie", dai personaggi, alle colonne sonore, agli sfondi e tutto il resto, in poco tempo e attraverso l'uso delle sole parole". Cristóbal Valenzuela si immagina così il futuro prossimo. Originario di Santiago del Cile, dirige la Runway, che ha fondato nel 2018 assieme ad altri due immigrati conosciuti all'Università a New York: Anastasis Germanidis, greco, e Alejandro Matamala-Ortiz, anche lui cileno. La loro Intelligenza Artificiale Gen-2, che nel giro di qualche settimana verrà aperta al pubblico, è la prima che permette di creare video partendo dal testo, oppure di aggiungere, togliere, sostituire qualsiasi elemento da uno esistente. La promessa di arrivare a tanto è stata sufficiente per racimolare finanziamenti per cinquanta milioni di dollari, portando la valutazione della compagnia a più di mezzo miliardo. La cosa sorprendente è che i tre hanno un bagaglio tecnico che non è paragonabile a quello dei fondatori di altre compagnie come OpenAI. Valenzuela, ad esempio, è un designer, eppure è riuscito a mettere insieme diversi pezzi di tecnologia per dare vita ad una Ai generativa, dove Ai è acronimo di artificial intelligence, ovvero intelligenza artificiale. Un parvenu che potrebbe diventare uno dei ragazzi d'oro dell'industria hi-tech.

Una processione notturna nella Roma di inizio Ottocento creata con Midjourney nello stile di William Turner
Una processione notturna nella Roma di inizio Ottocento creata con Midjourney nello stile di William Turner 
L'intero settore è un fiume in piena che difficilmente si prenderà una pausa, come chiesto dalla lettera aperta firmata, fra gli altri, da Elon Musk o Yoshua Bengio, preoccupati della velocità con la quale si sta evolvendo. Le Ai si trovano nel loro "momento iPhone" sostengono alla Nvidia, che in fatto di processori e infrastrutture per le reti neurali ha pochi concorrenti. "Il numero di parametri dei nuovi modelli linguistici di grandi dimensioni è aumentato enormemente", ci racconta Michael Kagan, direttore tecnico della compagnia californiana, o se preferite chief technology officer. "Nel 2019 ne avevano 1,5 miliardi in media, oggi il servizio NeMo di Nvidia arriva ad un massimo di 530 miliardi. Raddoppiano in dimensioni ogni due o tre mesi". Curioso che Nvidia fino al 2012 si dedicasse per lo più alla costruzione di schede grafiche per videogame. Alcuni ricercatori si accorsero che la velocità di quei processori, le Graphics processing units (Gpu), poteva essere impiegata con un certo successo in altri ambiti: allenare le intelligenze artificiali come estrarre criptovalute.

Fra quei ricercatori c'era anche Ilya Sutskever, uno dei fondatori di OpenAi. Il risultato, restando alla sola Nvidia, si misura in un salto in avanti del titolo in borsa del 400 per cento in cinque anni. "È improbabile che sospendere temporaneamente lo sviluppo dell'Ai faccia la differenza per quanto riguarda le manipolazioni", sottolinea Kagan. "Dobbiamo adottare standard etici, il che porterà a pratiche responsabili nella raccolta e nella cura dei dati. Si dovrebbe ottenere una licenza per utilizzare un'immagine, le sembianze o la voce di qualcuno per addestrare i modelli di intelligenza artificiale".

La liceità delle banche dati, ecco l'argine che potrebbe rallentare il fiume in piena. Prima, però, dobbiamo citare un altro astro nascente spuntato dal nulla che sta facendo parlare di sé. Si tratta di Mohammad Emad Mostaque, il fondatore di Stability Ai. È l'azienda dietro l'algoritmo Stable Diffusion che trasforma testi in immagini, per ora gratuitamente, e che è alla base anche di Midjourney e di Gen-1 e 2 di Runway. Si è fatta notare nel 2022 e ha raccolto cento milioni di dollari già bruciati quasi tutti, stando alle malelingue. Del resto per allenare la sua intelligenza artificiale ha utilizzato 256 processori grafici di Nvidia, gli A100, sui server di Amazon, pagando una bolletta da 600mila dollari. Mostaque, quarantenne giordano di origine e britannico d'adozione, che oggi pubblica su Twitter i suoi selfie in compagnia di Jeff Bezos, ha una laurea in informatica e un lungo passato come analista nei fondi di investimento. Poco tempo fa si era messo in testa di aiutare i musulmani sviluppando una "Ai islamica" che avrebbe dovuto guidarli nel loro percorso di fede. Ha poi cambiato idea. Attualmente intende cominciare a monetizzare mettendo la sua Ai al servizio dell'industria cinematografica di Bollywood. Ad agosto ha siglato un accordo con la Eros International, una delle maggiori case di produzione di Mumbai.

Il mondo cinematografico al quale si sta rivolgendo mostra però segni di nervosismo. Difficile che con le Ai generative ci si possa trasformare in Steven Spielberg, ma certo mettono a rischio una parte degli introiti legati alle piccole produzioni. E poi c'è la questione delle banche dati, o meglio della proprietà intellettuale, come sanno bene ad Nvidia, che è stata sollevata per la prima volta in Italia da fumettisti e disegnatori. La forza delle intelligenze artificiali generative nasce da grandi database sui quali si sono allenate e dove prendono gli elementi per fornire quanto viene loro chiesto, foto del Papa con piumino inclusa. Per le immagini fra i maggiori c'è Laion, messo in piedi da una non profit tedesca con l'intento di "rendere disponibili al pubblico modelli di apprendimento automatico su larga scala". Cinque miliardi di contenuti pescati sul web senza chiedere uno straccio di permesso, con la scusa della ricerca non a fini di lucro. Una pratica antica che risale ai tempi del database ImageNet nato nel 2010 sul quale OpenAi e altri si son fatti le ossa.

A Getty Images la cosa non è piaciuta e a febbraio ha fatto causa a Stability Ai coinvolgendo anche Laion. Il punto, sostiene l'agenzia fotografica, sta nella capacità straordinaria di queste Ai: se sono in grado di produrre un'immagine o un video nello stile di un certo fotografo, pittore, fumettista, regista, significa che hanno manipolato la loro opera che è protetta dal diritto d'autore. Nel caso specifico di Getty Images si parla di oltre dodici milioni di fotografie. Del resto può capitare, creando un'immagine con Midjourney come è successo a noi, che compaia in filigrana il logo dell'agenzia fotografica.

Dove non arrivano i garanti della privacy, potrebbe quindi arrivare il copyright. "Penso che sia stato un errore", sostiene Valenzuela riferendosi alla proposta di una moratoria. "È un chiudere le porte quando abbiamo bisogno di più opportunità di discussione per una tecnologia che è appena agli inizi. Consente di raccontare nei modi più diversi offrendo possibilità che in passato si potevano solo sognare. Sono gli strumenti alla base della prossima ondata espressiva, altamente democratizzata e accessibile". Resta il problema delle manipolazioni selvagge, ma si stanno già studiando sistemi per individuare le immagini fasulle fatte con una Ai generativa. Ovviamente usando le Ai. Anche perché noi difficilmente ne saremmo capaci e ormai la cosa rischia di sfuggire di mano.