✕

Come addestrare l’intelligenza artificiale e salvare il mondo

Sapete per cosa sta la “p” di Chatgpt? Ce lo ha spiegato Marco del Tredici, professione Ai scientist, durante questa lunga via di mezzo tra un corso e un’intervista
9 minuti di lettura

Barcellona. L’intelligenza artificiale fa miracoli. In questa storia almeno due. Il primo è quello con cui ChatGPT e i suoi fratelli (o le sue sorelle?) ci stupiscono ogni giorno, rispondendo a domande terribilmente complesse con una scioltezza preternaturale. Il secondo riguarda un trentottenne di Gallarate (Varese), laureato in Scienze della comunicazione con una tesi sui romanzi ambientati nel mondo del lavoro, che per un po’ ha fatto il giornalista in Liguria, poi il barista a Dublino e ancora a Madrid prima di rimettersi a studiare, imparare da solo a programmare e diventare, in una decina d’anni, un pluripubblicato e stimatissimo AI Scientist prima ad Amazon e ora alla canadese Cohere. Che, con una valutazione di oltre 2 miliardi di dollari, è tra le più promettenti startup al mondo sull’IA generativa. L’azienda, per semplificare, sta tentando di superare il limite più imbarazzante di questo tipo di macchine, ovvero l’inaffidabilità fattuale. Cercando di fornire, assieme alle ri…

Barcellona. L’intelligenza artificiale fa miracoli. In questa storia almeno due. Il primo è quello con cui ChatGPT e i suoi fratelli (o le sue sorelle?) ci stupiscono ogni giorno, rispondendo a domande terribilmente complesse con una scioltezza preternaturale. Il secondo riguarda un trentottenne di Gallarate (Varese), laureato in Scienze della comunicazione con una tesi sui romanzi ambientati nel mondo del lavoro, che per un po’ ha fatto il giornalista in Liguria, poi il barista a Dublino e ancora a Madrid prima di rimettersi a studiare, imparare da solo a programmare e diventare, in una decina d’anni, un pluripubblicato e stimatissimo AI Scientist prima ad Amazon e ora alla canadese Cohere. Che, con una valutazione di oltre 2 miliardi di dollari, è tra le più promettenti startup al mondo sull’IA generativa. L’azienda, per semplificare, sta tentando di superare il limite più imbarazzante di questo tipo di macchine, ovvero l’inaffidabilità fattuale. Cercando di fornire, assieme alle risposte, delle specie di note a piè di pagina che permettano di verificarne la provenienza.
Benvenuti quindi nel sorprendente mondo di Marco Del Tredici che, in una conversazione intermittente lunga tre giorni, ci spiegherà, tra le altre cose, come l’algoritmo smonti e rimonti la lingua, come lui e altri tipo lui stiano provando a ridurre la quantità di sfondoni prodotti dai modelli linguistici e come, nonostante l’effervescenza internazionale di iniziative e leggi per regolamentarla, quella dell’IA fine-del-mondo sia la classica notizia largamente esagerata.

Un Cv molto poco italiano

Per rendere il tutto ancora meno convenzionale Del Tredici ha scelto di lavorare da Barcellona, in modalità fully remote, la versione estrema dello smart working, per cui non solo non sei tenuto a mettere piede in ufficio ma neppure a vivere nello stesso continente. Il motivo per cui indugio sul curriculum è che si tratta del percorso di studi meno tipicamente italiano in cui mi sia mai imbattuto. In America niente è più normale di aver studiato poesia all’università e finire a lavorare nella finanza. Da noi no.

Per questo risplende il caso di questo umanista convinto, arrivato a Milano Bicocca grazie a una borsa di studio (il padre è imbianchino, la madre segretaria, fratello e sorella lavorano nel sociale a Sanremo, dov’è cresciuto anche lui) che dopo una pausa di qualche anno si iscrive a un master di linguistica a Bologna. Lì si appassiona alla semantica computazionale – per cui il significato delle parole è esprimibile (anche) per via matematica – insegnata da Malvina Nissim e decide che vuol fare proprio quella cosa lì. Si mette a imparare il linguaggio di programmazione Python frequentando corsi gratuiti sulla piattaforma Coursera. Fa una tesi su un metodo più efficiente di classificare i testi che poi viene presentata al Lrec, tra le più importanti conferenze internazionali di linguistica. Fa domanda per un dottorato ma nessuno gli risponde e considera di dedicarsi alla fotografia quando, in extremis, lo accettano in quattro università diverse e decide per Barcellona. Lavora per Expert Systems, un’azienda modenese specializzata sulla ricerca semantica, utile tra l’altro per capire il sentiment, ciò che le persone in rete pensano di certe aziende. Da stagista ad Amazon lavora ad estrarre dalle recensioni dei prodotti, attraverso modelli linguistici molto più rudimentali di quelli dei chatbot odierni, informazioni utili («Se decine di utenti lodano la durata della batteria ma le specifiche non ne parlano, è importante valorizzarlo»). Completato il dottorato ad Amsterdam, nell’estate 2020 Amazon lo assume a Berlino nella divisione Alexa. Deve occuparsi delle risposte time sensitive, in cui il fattore tempo è decisivo («Alla domanda “cosa ha fatto l’Inter” Alexa deve capire che ciò che interessa è il risultato dell’ultima partita») e gestire le domande anaforiche, quelle concatenate in cui il parlante non ripete necessariamente il soggetto («“Chi è Biden? E quanti anni ha?” Per noi è chiaro chi sia sottinteso, per la macchina no»). Ci resta un paio di anni e arriviamo a oggi.

La lingua e gli embedding

La nostra conversazione si svolge, su tre sessioni da due ore al giorno (troppo densi i concetti, serve tempo per assimilare) nell’appartamento che Del Tredici divide con la fidanzata israeliana. Partiamo dalle basi, dal fatto che gli umani si esprimono con parole e frasi mentre i computer capiscono solo sequenze di numeri. Bisogna quindi assegnare numeri alle parole. Immaginate un piano, con ascisse e ordinate, o se vi torna più facile, il campo da gioco della battaglia navale. Se “banana” e “fragola” si trovano rispettivamente all’incrocio tra la riga 5 e la colonna 5 e tra la 5 e la 6 anche “mela” sarà da quelle parti, magari su 5 e 4. Questo, tecnicamente, si chiama un word embedding, un abbinamento tra parole e numeri (mela, 5,4), a due sole dimensioni. Dimensioni che, oltre alla somiglianza tra i termini, possono contenere molte altre proprietà, tipo età e stazza, per cui un cucciolo di cane sta a un cane adulto nello stesso rapporto in cui un vitello sta a una mucca. Tutte queste coordinate (il modello di Cohere ne raggruppa fino a 4.096 per ogni termine) costituiscono un vettore, ovvero la serie di numeri che descrivono le parole. Lo stesso approccio può essere applicato alle frasi, per cui “mi piace il mio cane”, “amo il mio cane” e “adoro il mio cane” avranno vettori con valori molto simili. Elaborando questi vettori, il modello linguistico predirà quale parola, in un determinato contesto, è più probabile che segua un’altra. Ad oltranza, fin quando non avrà completato la risposta alla domanda (prompt).

Addestramento, affinamento, rinforzo

Ma come fa a predire? «Ci sono tre momenti cardine dell’addestramento di un modello: il pretraining, il fine tuning e l’apprendimento con rinforzo (Reinforcement learning from human feedback)» spiega Del Tredici, scarabocchiando con una matita su un quadernetto. «Il pretraining (la P di GPT, ndr) è la fase più lunga e costosa. Quella in cui il modello viene esposto a una massa immane di informazioni, essenzialmente miliardi di testi su internet. Ma non sotto forma di parole intere, quanto di token (parti di parole, spesso di un paio di sillabe) per alleggerire lo sforzo computazionale dei server». Al termine di questa indicizzazione, che per GPT-3 avrebbe richiesto un anno, «il modello costruisce una sua rappresentazione di conoscenza basata sulle occorrenze di certi termini in associazione con altri». È a quel punto che bisogna insegnargli cosa fare di ciò che ha imparato. «È un addestramento più piccolo, con pochi dati specifici che servono a fargli apprendere un task, un compito, mostrandogli domande e risposte giuste, fornite dai supervisori umani. Generalizzando da quegli esempi lui dovrà poi generare le sue risposte. Così, se gli chiedi “qual è la capitale del Canada?” non dovrà snocciolare tutte le capitali che conosce ma dovrà restare in tema. Il livello di errore alle domande si calcola con la funzione matematica di loss function. Per ridurlo si cambiano alcuni parametri attraverso un algoritmo di backpropagation, si fa ripartire il modello e si valutano i miglioramenti». “Prova ancora, sbaglia ancora, sbaglia meglio” come scriveva, pensando ad altro, con assai meno ottimismo, Samuel Beckett in Worstward Ho., un racconto del 1983. I modelli più avanzati sono in grado di imparare da pochissimi esempi (few shot learner) e talvolta possono addirittura saltare la fase di affinamento (zero shot learner). Com’è possibile? «Se il compito è di capire quali sono le recensioni positive o negative di un film, ad esempio, e il modello è stato addestrato anche sulla banca dati cinematografica di Imdb, è possibile che alcuni recensori abbiano scritto, esplicitamente, che il loro è un “giudizio negativo”. E da quel termine esplicito il modello potrà dedurre, per differenza o somiglianza, a quanti il film è piaciuto o no». Sono ragazzi/e molto svegli/e questi Llm, non c’è che dire.

Curare le allucinazioni

Ma come a volte capita ai ragazzi svegli, quando si credono troppo svegli, e quindi non sfiorati dal dubbio, è che le sparano grosse. In gergo partoriscono “allucinazioni”, come quelle degli psicotici convinti di vedere o sentire cose che sono solo nella loro testa. Prima che vi venga la tentazione di alzare il ditino e ridicolizzarli, però, visualizzate ancora per un attimo il metodo con cui i modelli hanno imparato ciò che sanno. Ovvero: avendo ingurgitato miliardi di pagine, spezzettate in token, di cui non sanno il significato ma solo la rappresentazione matematica. Meglio abbassare il ditino, no? La squadra di cui fa parte Del Tredici cerca proprio di costringere il modello a essere meno apodittico e più umile, costringendolo ad addurre le prove di quanto sostiene: «Invece di rispondere solo sui parametri con cui è stato addestrato andrà su un indice di documenti, che possono essere internet, una pagina Wikipedia ma anche documenti interni a una certa organizzazione, e nella risposta citerà il punto da cui ha preso l’informazione. Così facendo il rischio di allucinazione si riduce di moltissimo». E ciò è coerente (la ragione sociale Cohere allude proprio a questa qualità) con la clientela preferenziale a cui si rivolgono: le aziende. Ancora il nostro eroe: «Ogni azienda ha la sua base di dati. Se tu la rendi accessibile al modello, lui ne diventa specialista. Per noi, a differenza di altri chatbot, l’obiettivo fondamentale è proprio l’affidabilità». Non necessariamente quei «5 nove» (99,999 per cento di precisione) richiesti dal responsabile IA dell’esercito Usa, Craig Martell, prima di usare in combattimento un’arma autonoma, ma sicuramente un livello più alto di quello odierno. Ancora il linguista italiano: «Il modello non ha cognizione della propria conoscenza. Non basta che una volta abbia incontrato l’informazione giusta: per darle un “peso”, metabolizzarla, deve essercisi imbattuto più volte. È il motivo per cui difficilmente sbaglierà la data della scoperta dell’America, mentre altre tappe storiche sono più a rischio. Il nostro team di Retrieval augmented generation (Rag), generazione sulla base del risultato di ricerca, àncora la risposta a un documento specifico». E a quel punto, ma per quanto mi riguarda già da adesso, è verosimile una fuga di massa dai motori di ricerca e un trasloco epocale verso i chatbot. Perché cercare quando puoi trovare?

Pericolo esistenziale? Ma va là

Di digressione in digressione ci siamo persi l’ultimo passaggio, l’apprendimento con rinforzo. Del Tredici: «È il momento del cosiddetto “allineamento” della macchina con i valori degli esseri umani. In cui cercare che le risposte non risultino offensive, razziste, omofobe né replichino i vari bias accumulati durante il pre-training». La fase in cui si diserba il modello dalle erbacce: «Nel farlo gli annotatori umani forniscono sia la domanda che la risposta giuste. Oppure solo una preferenza tra due risposte entrambe corrette. Che sembra un metodo meno preciso ma in realtà allena il sistema a essere più flessibile e meno letteralista, in grado di carpire differenze anche minime nelle formulazioni delle domande. Proprio come farebbe un umano che sa bene che “adoro” o “vado in brodo di giuggiole”, semanticamente parlando, sono vicini di casa». Quindi di vettore. I red team, le squadre specializzate nel provocare risposte a rischio da parte della macchina, sono anche quelle che dovranno poi insegnare al modello a non generare le fake news o i contenuti d’odio. È da questa potenziale eruzione di falsità che prendono le mosse gli allarmi sui “rischi esistenziali” collegati all’IA? Del Tredici, uomo supremamente razionale, imperturbabile ai confini dell’androide, accenna per la prima volta a un risolino: «È importante discutere di ogni rischio, tra noi privati e con i legislatori, ma distinguerei i problemi reali dalla fantascienza. Esattamente, di che parliamo quando diciamo “esistenziali”? E dove sarebbero le serie storiche di estinzioni sulla base delle quali calcolare questi rischi?».

«L’Ia è conscia? Lievemente»

Il suo celebre collega Ilya Sutskever, scienziato capo di OpenAI, ha suscitato un mezzo caso definendo GTP-4 «lievemente conscia». Che ricorda un po’ il «sono un po’ incinta» del titolo di una commediaccia con Jennifer Lopez– ma questo lo dico io perché il mio interlocutore è rispettosissimo della concorrenza e le regole di ingaggio erano che non gli chiedessi giudizi su di loro. Quindi, in generale: «La stessa definizione di coscienza è problematica. Come quella di “intelligenza artificiale generale” (Agi). Quel che mi sento di dire è che questi strumenti diverranno sempre più utili, in grado di affrontare compiti sempre più complessi». Cita un paper recente dal titolo Sparkles of Agi, scintille di intelligenza artificiale generale, e chiarisce: «Non sarà un passaggio binario, dall’IA di oggi all’Agi di domani. Sarà una transizione. In questi dieci anni ho visto un miglioramento costante: nel mantenere un dialogo, riassumere testi, scrivere codici le intelligenze artificiali hanno già, per molti versi, superato gli umani. Ma non bisogna, pensando a un loro comportamento autonomo, confondere “saper fare” con “voler fare”». Gli racconto del software Automated Insights cui, da anni, Associated Press fa scrivere brevi di finanza e di sport e che non è niente in confronto ai modelli linguistici attuali: meglio cercare da subito un piano B? «Anche qui, se si tratta di riassumere e assemblare notizie già scritte ma anche allenare un modello per creare un racconto da una serie di dati, ciò è già largamente possibile. Ma la bravura del giornalista è, a partire dall’evento, ricavare riflessioni più alte. Ciò che rendeva Brera Brera, non era dirti il minuto esatto in cui avveniva una rovesciata ma partire di lì per digressioni interessanti, per raccontarti il mondo. Uno che scrive ha, come propulsore di base, qualcosa che gli preme dire. In un modello questo non c’è. Puoi cambiare la sua “temperatura”, ovvero aumentare il livello di stocasticità nella previsione della parola successiva da predire e renderla meno standard, più strana, imprevedibile. Puoi ottenere un effetto Queneau, tipo Esercizi di stile, con la differenza essenziale che lui voleva scrivere così mentre il modello ne copia gli stilemi, non ha alcuna intenzionalità». Fiuuu, per qualche anno ancora dovremmo scamparla.

Studia, guarda i risultati, correggi

Torno a bomba. Ma allora perché giganti del settore come Geoffrey Hinton, Joshua Bengio e lo stesso Sam Altman fondatore di OpenAI, in una specie di “momento Oppenheimer” collettivo, denunciano ai quattro venti di aver fatto uscire dalla bottiglia un genio che potrebbe rivelarsi “distruttore di mondi”? «Per quanto abbiano dato contributi enormi, quindi con il massimo rispetto, non lo so: non so sulla base di quali prove parlino. È una loro opinione, rispettabile, ma ce ne sono anche altre. Alla fine si tratta di potenti programmi che girano su grossi computer. Banalizzando, ma fino a un certo punto, basta staccare la corrente e il programma smette di girare, cessa di esistere». Insisto. Mi ero preparato una nutrita lista di aneddoti inquietanti. Li sciorino ma non faccio breccia. In città – la conversazione s’è svolta in estate – sono 36 gradi che, nel combinato disposto con l’umidità, producono un caldo che sfiancherebbe un cammello. Il programmatore punta il dito verso la piazzetta, fuori dalla finestra: «Vuole un esempio di rischio esistenziale, con tanto di prove? Eccolo. È stato calcolato che, se l’aumento della temperatura supera i 2 gradi rispetto al periodo pre-rivoluzione industriale ci saranno X e Y effetti sul Pianeta». Mi viene in mente una straordinaria frase di George Orwell quando dice «Ci vuole uno sforzo costante per vedere quello che abbiamo davanti al naso». Forse vale anche qui. Prima di capire la fisica del clima mettevamo in conto i fulmini all’ira degli dei. Oggi l’apocalisse alla magia nera degli algoritmi: «Peccato che non ci sia alcuna magia. Resta sorprendente, anche per me, ma alla fine è tutto spiegabile decostruendo il modello matematico che ci sta sotto. Per questo una moratoria non mi sembra avere senso: l’unica è continuare a studiare, guardare i risultati, correggerli. E sederci tutti insieme intorno a un tavolo per discutere come migliorarli». Alle brutte resta sempre l’opzione nucleare: spegni e riaccendi.

Sul Venerdì del 1° dicembre

Leggi i commenti