✕

I tre maghi tedeschi degli algoritmi per l’Ai generativa alla portata di tutti

Per una volta non vengono dalla Silicon Valley gli inventori del miglior linguaggio per trasformare i testi in immagini e video “Vogliamo fornire la materia prima per quello che verrà tra cinque o dieci anni, senza che sia tutto nelle mani dei colossi Usa”
3 minuti di lettura

Cammina per il parco nei pressi di casa, ad Amburgo, mentre i figli giocano con i loro coetanei. Christoph Schumann, 40 anni, insegnante di informatica in un liceo locale, ha l’aria e i modi di una persona come tante altre. Eppure alcune delle migliori intelligenze artificiali generative gli devono molto e devono molto pure a un paio di dottorandi sempre tedeschi di nome Robin Rombach e Patrick Esser. Sono loro che hanno permesso la nascita degli algoritmi più abili a trasformare testi in immagini, sorti per una volta lontano dalla Silicon Valley. Consentono di ottenere una foto, un’immagine o un dipinto in qualsiasi stile scrivendo solo alcune parole chiave. E a breve si potrà fare lo stesso con i video, che rappresentano oltre il settanta per cento del traffico web.

L’ex attore informatico

«Lo dicevo già nel 2016: fra qualche tempo un qualsiasi adolescente con il suo computer sarà in grado di realizzare un film come Il signore degli anelli. Nessuno mi credeva e invece ci stiamo a…

Cammina per il parco nei pressi di casa, ad Amburgo, mentre i figli giocano con i loro coetanei. Christoph Schumann, 40 anni, insegnante di informatica in un liceo locale, ha l’aria e i modi di una persona come tante altre. Eppure alcune delle migliori intelligenze artificiali generative gli devono molto e devono molto pure a un paio di dottorandi sempre tedeschi di nome Robin Rombach e Patrick Esser. Sono loro che hanno permesso la nascita degli algoritmi più abili a trasformare testi in immagini, sorti per una volta lontano dalla Silicon Valley. Consentono di ottenere una foto, un’immagine o un dipinto in qualsiasi stile scrivendo solo alcune parole chiave. E a breve si potrà fare lo stesso con i video, che rappresentano oltre il settanta per cento del traffico web.

L’ex attore informatico

«Lo dicevo già nel 2016: fra qualche tempo un qualsiasi adolescente con il suo computer sarà in grado di realizzare un film come Il signore degli anelli. Nessuno mi credeva e invece ci stiamo arrivando», spiega Schuhmann. Ex attore, psicologo poi convertito all’informatica, è una delle menti di Laion, acronimo di Large-scale Artificial Intelligence Open Network. Un database gestito dall’omonima non profit che contiene 5 miliardi e 800 milioni di contenuti sui quali sono stati addestrati e traggono la loro forza gli algoritmi di Stability Ai, Runway e con buona probabilità Midjourney, il quale non ha svelato il dataset che usa ma ha più volte dialogato con Schuhmann. Alla prova dei fatti si stanno dimostrando migliori dell’equivalente di OpenAi, ovvero Dall-E 2.

La storia

«Quando a gennaio del 2021 vidi la prima versione di Dall-E rimasi a bocca aperta», prosegue il professore di liceo. «Siamo partiti da Common Crawl (database di contenuti Web usato anche da OpenAi per Gpt, ndr) e da lì è nato il nostro archivio. In Laion lavoriamo tutti su base volontaria. Il punto non è solo permettere di sviluppare Ai generative a chiunque voglia farlo, ma di fornire la materia prima per quel che verrà fra cinque o dieci anni. Senza che sia tutto nelle mani dei colossi Usa».  Fin dai tempi di ImageNet, che nel 2009 con il suo catalogo di 14 milioni di immagini consentì di addestrare le prime Ai per il riconoscimento delle immagini, sono i database a fare la differenza. Laion, che è gratuito e accessibile a tutti, ha cambiato gli equilibri perché quello dei database è un punto di partenza nello sviluppo dell’intelligenza artificiale. Tanto che l’Ai Act, approvato dal Parlamento europeo di recente, prevede che chi ha sviluppato Ai ritenute ad “alto rischio”, sveli su quali dataset sono state istruite. In risposta Sam Altman, a capo di OpenAi, ha minacciato di chiudere le operazioni in Europa.

I due soci

Laion in tre mesi è arrivato a un catalogo di 430 milioni di immagini e da allora non si è più fermato. Si unirono al gruppo anche Robin Rombach, dottorando in informatica oggi a capo della ricerca della britannica Stability Ai, e Patrick Esser, suo collega passato alla newyorkese Runway, specializzata in video. Sono le due startup più promettenti in questo campo. Usano un modello nuovo chiamato Stable Diffusion, realizzato partendo dal lavoro svolto da Rombach e Esser all’Università Ludwig Maximilian (Lmu) di Monaco. È stato rilasciato gratuitamente in collaborazione da Stability Ai, Lmu e Runway, con il supporto di Laion e del gruppo di ricerca indipendente EleutherAi.  «La forza del modello Stable Diffusion è quella di riuscire ad assimilare i dati capendo qual è la gerarchia degli elementi importanti in un’immagine o in un altro contenuto», ha spiegato Robin Rombach. «E questo porta a un uso molto minore della potenza di calcolo. Sintetizziamo solo le informazioni rilevanti potendo così assimilare più velocemente».

Restando in tema Stability Ai, fondata dal britannico Mohammad Emad Mostaque, altro parvenu, ha fornito gratuitamente potenza di calcolo e assistenza legale a Laion visto la questione del copyright. È una non profit, non guadagna nulla, ma ha pescato a strascico contenuti di ogni tipo e rischia di finire in tribunale. Questi dataset, nati a scopo di ricerca, diventano infatti un tassello essenziale di imprese commerciali. «Noi non distribuiamo contenuti», puntualizza Schuhmann. “Laion contiene link che portano a elementi raggiungibili da chiunque sul web. Ma la trasparenza è importante: costringe tutti a dichiarare cosa si sta facendo e in quale modo».  Schuhmann è convinto che le Ai generative di immagini saranno quasi perfette in breve tempo, mentre per i video ci vorranno ancora due o tre anni. Secondo lui si tratta però solo di un primo passo. Le stesse tecnologie possono essere usate per far apprendere a un robot come muoversi in qualsiasi ambiente con una visione artificiale evoluta in grado di ricevere comandi vocali o di testo e di tradurli in azione osservando cosa ha intorno a sé. «Avere paura che le Ai prendano il controllo mi sembra sciocco», conclude. «Bisognerebbe preoccuparsi molto di più degli effetti che avranno sulla società introducendo cambiamenti molto veloci ai quali i più faranno fatica ad adattarsi. E quando ci si sente confusi, spaventati e insicuri, storicamente ci si rivolge verso politici che cavalcano le paure e propongono soluzioni radicali pericolose». Non ha tutti i torti, anche perché sta già accadendo.

Leggi i commenti