ChatGPT, meraviglie e pericoli dell'intelligenza artificiale
dal nostro inviato Riccardo Staglianò , dal nostro inviato Riccardo StaglianòNEW YORK. Con un nome non esattamente memorabile la sua popolarità è doppiamente sorprendente. Ottocentocinque milioni di risultati sul motore di ricerca che forse soppianterà, in quattro mesi e rotti dalla nascita, è un risultato senza precedenti. Dalla sera del 30 novembre in cui è ufficialmente venuta al mondo, ChatGPT è la notizia tecnologica che ha annichilito tutte le altre. Trattasi della prova ontologica dell'esistenza dell'Intelligenza Artificiale Generale (AGI), il futuribile livello in cui le macchine diverrebbero capaci di fare quasi tutto quel che facciamo, ma meglio? O più prosaicamente del killer di Google? E di buona parte di coloro che campano scrivendo? Bill Gates, che ha un conflitto di interessi lungo 10 miliardi di dollari (dalla cifra che Microsoft ci ha investito) ma ci tiene anche a non passare per pirla, quanto a coefficiente di innovazione paragona ChatGPT al pc e a internet. Un ristretto ma combattivo …
NEW YORK. Con un nome non esattamente memorabile la sua popolarità è doppiamente sorprendente. Ottocentocinque milioni di risultati sul motore di ricerca che forse soppianterà, in quattro mesi e rotti dalla nascita, è un risultato senza precedenti. Dalla sera del 30 novembre in cui è ufficialmente venuta al mondo, ChatGPT è la notizia tecnologica che ha annichilito tutte le altre. Trattasi della prova ontologica dell'esistenza dell'Intelligenza Artificiale Generale (AGI), il futuribile livello in cui le macchine diverrebbero capaci di fare quasi tutto quel che facciamo, ma meglio? O più prosaicamente del killer di Google? E di buona parte di coloro che campano scrivendo? Bill Gates, che ha un conflitto di interessi lungo 10 miliardi di dollari (dalla cifra che Microsoft ci ha investito) ma ci tiene anche a non passare per pirla, quanto a coefficiente di innovazione paragona ChatGPT al pc e a internet. Un ristretto ma combattivo gruppo di critici segnala che OpenAI, la società che l'ha inventata, è stata solo immensamente più brava nel marketing ma cose del genere esistevano già, però se ne parlava al chiuso dei laboratori, nell'attesa che fossero davvero pronte. E che in ogni caso il traguardo per l'Ia Generale non sarebbe più a portata di mano di quanto non lo sia per le auto guidarsi davvero da sole. Vale a dire: campa cavallo. Il suo stesso amministratore delegato, Sam Altman, ha dichiarato che "ChatGPT è incredibilmente limitata, ma sufficientemente buona in certi ambiti da dare la fuorviante impressione di grandezza. È un errore farci affidamento oggi per cose importanti. È un'anteprima di progresso: abbiamo molto lavoro da fare quanto a robustezza e veridicità del sistema". È raro ascoltare i genitori parlare dei figli con tanta lucidità, ma quando succede sarebbe da stolti non prestar loro attenzione.
Sia quel che sia, occupandomi di tecnologia da oltre un quarto di secolo, non ricordo un livello di eccitazione comparabile, appunto, dalla nascita del web. Dopo tanti AI winter, quegli inverni in cui, dopo aver visto sbocciare promettenti germogli, l'Intelligenza Artificiale andava in ibernazione e, come un cameriere terminalmente distratto, non portava mai il piatto principale nonostante un paio di antipasti gustosi, potrebbe essere la volta buona. Posso sbagliare ma, da tutta una serie di indicatori che cercheremo di squadernare, stavolta è diverso. Siamo all'alba di una nuova èra dell'IA. Il dato sorprendente, nell'affollatissima pubblicistica sull'argomento, è che siamo subito passati al dibattito (Usarla o bandirla nelle scuole? È razzista o inclusiva? Onnisciente o cazzara?) fino al solitario intervento del nostro Garante della privacy che l'ha messa temporaneamente fuori legge in Italia, il tutto senza neppure provare a spiegare come funziona. Un po' perché la risposta esaustiva comporterebbe l'utilizzo di più equazioni che di lettere dell'alfabeto. Ma soprattutto per pigrizia: il fatto che entrare nella sua scatola nera sia arduo al confine col masochismo non lo rende meno necessario. Di seguito, consapevoli di arrivare buoni ottocentomilionesimi, ci proviamo.
Come funziona
Su Amazon sono già apparsi degli instant book autopubblicati, di autori sconosciuti, forse scritti da ChatGPT per spiegare ChatGPT. Invece, a differenza di qualsiasi altro argomento tecnologico, articoli autorevoli ma chiari su come funziona davvero non li ho trovati. Quindi dopo un paio di fondamentali, densissime e a tratti umilianti (come certe interrogazioni di fisica) chiacchierate con Malvina Nissim, una talentuosa linguista computazionale pisana che insegna all'università di Groninga, in Olanda, ho pensato che l'ideale fosse andare alla fonte. Intesa non come OpenAI, che non ha risposto a reiterate richieste di intervista, ma di chi, molti anni prima, ha eretto le fondamenta dell'edificio che ci avrebbero costruito sopra. L'Intelligenza Artificiale ha il suo Nobel. Si chiama Premio Turing, vale un milione di dollari (finanziati da Google) e, per il loro lavoro sulle reti neurali, nel 2018 è andato ex aequo al britannico Geoffrey Hinton e ai francesi Yann LeCun, capo dell'IA a Meta, e Yoshua Bengio, direttore del Montreal Institute for Learning Algorithms. È lui che sentiamo via Zoom da Montreal (e che, qualche settimana dopo, sarà il primo firmatario di una lettera aperta sottoscritta da un migliaio di specialisti per chiedere all'industria una pausa di riflessione di sei mesi sugli ulteriori sviluppi o, in sua assenza, una moratoria imposta dagli Stati).
Ma prima di dargli la parola, una spiegazione brutalmente semplificata di cos'è una rete neurale, perché è quello il campo da gioco su cui vengono costruiti i modelli linguistici (Large language models, Llm) attraverso i quali le macchine imparano a fare un sacco di cose. Fino a una decina di anni fa gli algoritmi che provavano a comprendere o tradurre automaticamente i testi lavoravano concentrandosi su una parola alla volta, serialmente come si direbbe in informatica. Ma il cervello non funziona così: i neuroni funzionano su vari livelli, in parallelo, creando delle sinapsi, connessioni stabili, in risposta a diversi stimoli. Ecco, le reti neurali provano a replicare lo schema del cervello. Con al posto dei neuroni i microprocessori.Torniamo dunque dal professor Bengio e alla sua intuizione di ventitré anni fa: "All'epoca le reti neurali provavano a indovinare la singola parola successiva perché le parole venivano considerate simboli. Noi abbiamo proposto di considerarle vettori, gruppi di numeri che descrivessero l'attivazione della rete di fronte a un determinato elemento. Se dico "gatto" nel nostro cervello alcuni neuroni (quelli associati a felino, mammifero, quadrupede, e così via, ndr) si attiveranno di più, altri meno, creando un pattern che, in matematica, si può rendere appunto con un vettore. Ogni parola ha il suo. E, attraverso la sua capacità di calcolo, la rete potrà desumere dall'interazione tra i vari pattern quale parola è più probabile che segua a un'altra, in un certo contesto".
La scoperta dell'attenzione
Il paper di Bengio, tra i più decisivi nello sviluppo dei GPT (Generative Pre-trained Transformer, transformer generativi pre-addestrati, ecco spiegato il nome) come stiamo iniziando a conoscerli risale al 2014 e riguarda il concetto di "attenzione". Ancora lui: "Prima, per tradurre un libro dall'italiano all'inglese, l'algoritmo lo memorizzava tutto intero e lo sputava fuori tutto insieme. Noi invece abbiamo dimostrato che funzionava molto meglio leggendolo in italiano e traducendo man mano in inglese, tornando indietro all'italiano per capire, grazie ai "pesi" delle connessioni tra le parole, qualcosa di simile alle sinapsi, quali fossero quelle davvero importanti per stabilire il significato del termine da tradurre. E questa scelta - non tutte le parole hanno lo stesso peso - è ciò che abbiamo chiamato attenzione. Il meccanismo sulla base del quale, tre anni più tardi, un gruppo di ricercatori di Google ha inventato i transformer, ovvero l'ultima lettera di ChatGPT". Di che trasformazione staremmo parlando? Del fatto che queste reti capiscono che le associazioni tra le parole, o meglio i word embeddings, le loro rappresentazioni matematiche espresse come vettori, sono alterate da quelle che gli stanno attorno, non necessariamente subito prima o subito dopo, ma anche quelle più lontane nella frase. E a forza di addestrarsi a predire parole mancanti in milioni di frasi la rete acquisisce non solo il significato delle singole parole ma quello di strutture semantiche più grandi.
L'anno dopo OpenAI, fondata nel 2015 anche grazie ai finanziamenti di Elon Musk, allora molto preoccupato che l'Intelligenza Artificiale lasciata a se stessa fosse la minaccia esistenziale più grande per l'umanità (salvo poi includere Ai nel nome di uno dei figli), aveva incominciato a lavorare ai transformer per sviluppare Large language models. Prima con il GPT-1, poi con il GPT-2 quindi con il GPT-3 (2021) che faceva un salto di cento volte rispetto alla versione precedente avendo 175 miliardi di parametri, un'unità di misura complessa che assomiglia più alle sinapsi che ai neuroni, sviluppati dopo essere stato "alimentato" con circa 200 miliardi di parole durante l'addestramento (un tredicenne, a cui è spesso comparato quanto a performance cognitive, in media viene esposto a meno di 100 milioni di lemmi). Un risultato strabiliante che, solo due mesi dopo, il GPT-4 ha già polverizzato, innescando l'appello dei mille specialisti, Musk incluso: rallentiamo, per fissare alcuni paletti, prima che sia troppo tardi, la Singolarità arrivi e ci ritroviamo tutti a servire le macchine!
Sbagli alla grande e allora?
Sin qui abbiamo dato per scontato, considerata la stupefacente copertura mediatica che questa tecnologia ha ottenuto, che tutti sappiano che cosa fa. Per chi si fosse perso le puntate precedenti dico che all'indirizzo chat.openai.com c'è una finestrella in cui, in tutte le lingue più parlate, si possono domandare a ChatGPT un sacco di cose. Scrivi un racconto breve con un chirurgo depresso come protagonista, alla maniera di Raymond Carver. Oppure à la Hemingway. Fammi un riassunto dei punti salienti del trattato Start sulla non proliferazione bellica. Puoi spiegare il concetto di carbon neutral a un bambino di sei anni? E come lo diresti a un ragazzo di 18? E a Trump? Puoi chiedere anche cosa sa della strage di piazza Fontana ma, quando l'ho fatto, era convinta che Pinelli fosse stato condannato e che c'entrasse anche Ordine nuovo, guidata allora da Adriano Sofri (a onor del vero, alcune settimane dopo questa grottesca affiliazione era scomparsa). Sì, perché la sua forza è la fluidità verbale, e lo stile, ma non la veridicità. A differenza di un motore di ricerca che trova un documento rilevante che poi sta a voi riassumere, ChatGPT genera un testo nuovo, che prima non esisteva, e che viene composto sulla base delle conoscenze, vaste ma appiccicaticce, che il software ha accumulato.
A scanso di equivoci, e per quelli che si meravigliano di certi sfondoni (in gergo queste topiche colossali vengono chiamate "allucinazioni"), il programma ha immagazzinato tantissimi fatti (o meglio, la loro descrizione linguistica) ma non ne capisce il significato. Sa solo che, mi spiega la linguista Nissim, "com'è più probabile che dopo "pizza" venga "pomodoro" rispetto a "segatura", dopo "piazza Fontana" possa venire anche "Sofri" perché magari in vari articoli che ha setacciato in passato figuravano entrambi i termini. Immaginate un umano che debba leggere mille pagine in due ore su qualcosa di cui non sa niente. Scorre, magari gli casca l'occhio su Sofri e, quando gli chiedono dei protagonisti, tira fuori quel nome". Con la differenza che, con una preparazione così abborracciata, probabilmente l'umano sarebbe più cauto mentre l'inconsapevole algoritmo - non capisce, calcola la probabilità delle associazioni tra i termini - non ha neppure la percezione dei propri limiti e finisce per essere stentoreo, nel bene e nel male. Meravigliarsi per gli errori, che ci sono e possono essere colossali, piuttosto per il miracolo di conoscenze che riesce a improvvisare (ChatGPT, tra gli altri, ha passato esami di diritto all'Università del Minnesota e di economia aziendale alla Wharton School of Business) rientra però nel classico strabismo albero/foresta.
Dove ha studiato?
Dicevamo che GPT-3 (in verità 3.5), il motore di ChatGPT precedente al 14 marzo, è stato esposto a circa 570 gigabyte di testo, pari a tutta Wikipedia in inglese (21 Gb) più corpora di ogni genere pescati a strascico da internet (ed è soprattutto su questa indiscriminata raccolta che il Garante italiano ha avuto da eccepire, dal momento che nostri post sui social, senza alcuna autorizzazione, possono essere finiti nel calderone di addestramento della macchina). Per la versione 4 si favoleggia di svariati trilioni di parametri e del fatto, per dirne una, che quando riusciva a passare l'esame statunitense da avvocato la release precedente si piazzava nel decile più basso mentre quella attuale nel più alto. Tutto inizia con il modello linguistico (Llm) che, senza supervisione umana, digerisce i dati grezzi. Su questo semilavorato poi vengono messe etichette da esseri umani, i cosiddetti "annotatori". Ovvero quelli che hanno insegnato al sistema che "verde" è un aggettivo, "gatto" un sostantivo e così via. Sulla base di quegli esempi l'algoritmo generalizza la classificazione. La cosa strepitosa, come OpenAI ha spiegato in un paper del maggio 2020 dal titolo Language Models Are Few-Shot Learners, è appunto che gli bastano pochi esempi per imparare come funzionano le regole del gioco linguistico, proprio come erano bastati pochi esempi al software AlphaGo per capire come si giocava a Go e battere il campione mondiale. Questa abilità ha fatto sì che, a partire dalla sua terza versione, GPT sia diventato un "meta-apprenditore", abbia imparato a imparare, anche compiti nuovi.
Il problema, per così dire, è che quel che non sa lo inventa. Come ha commentato l'informatico Douglas Summers-Stay "È come un comico di stand-up totalmente assorto nel suo show, che non è mai uscito di casa e ha una conoscenza solo libresca del mondo". Oppure in altri casi le risposte sono frasi prese di peso da testi che ha letto: "memorizzazione eidetica" la chiamano nel settore, un eufemismo per plagio, che fino al GPT-2 riguardava circa l'1 per cento delle risposte.
Addestramento e umani
Ma mettetevi nei panni di questo povero computer, che in realtà è un enorme server da 800-1000 Gpu (Graphics processing unit) che per funzionare emette la quantità di CO2 che un'auto impiegherebbe per andare dalla Terra alla Luna. Se qualcuno, come nell'esempio preso da Che cos'è la linguistica computazionale (Carocci) scritto da Nissim con Ludovica Pannitto, chiede anche solo ad Alexa "Alexa, ho fame. C'è un indiano nelle vicinanze?", riceveremo una risposta del tipo: "Ecco alcuni dei ristoranti più vicini". A noi sembra banale, ma l'algoritmo deve disambiguare il termine indiano: non è una persona che si sta cercando, ma un ristorante. Idem per "Ho divorato i russi, quest'estate, riferendoci ovviamente ai classici e non alla popolazione russa". Per scriminare serve un algoritmo, ovvero "una sequenza finita di passi elementari attraverso cui possiamo risolvere il compito", nel nostro caso linguistico. Un algoritmo come processo decisionale composto dai tre soliti ingredienti: input, output e funzione che lo produca, o meglio attribuisca diverse probabilità a varie risposte possibili. Per cui dopo le parole "buongiorno signore e..." c'è una probabilità del 90 per cento che segua "signori", una dell'1 per cento che sia "tassi" e una dello 0,2 che sia "oritteropi", degli insettivori africani. ChatGPT sceglierà la più probabile. E affinerà le sue capacità sia grazie all'"apprendimento supervisionato" che all'"apprendimento da rinforzo con feedback umano" dove il termine chiave è proprio umano: ci sono degli addestratori che valutano le risposte, danno loro dei voti e fanno una sorta di "sintonia fine" del meccanismo che poi il modello replicherà su vasta scala. Per inciso OpenAI, valutata 29 miliardi di dollari, un discreto numero di addestratori li ha reclutati in Kenya a due dollari l'ora o in altri Paesi dove il costo del lavoro oscilla tra il basso e il miserrimo. Gli altri collaudatori invece siamo noi (ed è per questo che il servizio è ancora largamente gratuito), i milioni di utenti che in questi mesi hanno usato la chat, magari correggendola o insultandola di fronte a errori particolarmente grossolani. Tipo la correlazione spuria tra Sofri e piazza Fontana. Più mille altre.
"Rischi? per chi scrive sicuro"
Generatore automatico di frasi simil-umane, "pappagallo stocastico" com'è stato definito, o pluripotente divinità informatica? Torno da Bengio, con le orecchie sempre più basse. Contestualizza: "Esistono altri sistemi comparabili, ma non ancora di pubblico dominio. Quando Microsoft rilasciò il suo assistente virtuale Tai fece una colossale figuraccia per le sue affermazioni razziste. Le grandi aziende devono essere caute, mentre le startup possono permettersi di non esserlo, per loro è comunque pubblicità". (Sull'onda del clamore per ChatGPT Google ha svelato l'esistenza del suo transformer Bard un cui errore, durante la presentazione alla stampa, è valso all'azienda un tonfo in borsa da 100 miliardi di dollari e per ora il servizio è accessibile solo dagli Stati Uniti). Ancora Bengio: "L'opinione pubblica tende a pensare all'innovazione come a un'esplosione improvvisa. Mentre noi sappiamo benissimo che anche quando il suo vaso straripa, com'è successo ora, in realtà si tratta di un riempimento avvenuto, goccia dopo goccia, per anni. Resta vero però che abbiano fatto un ottimo lavoro e che il prodotto sia piuttosto notevole, il migliore visto in pubblico sin qui". Ovviamente Bengio ne ha presente anche i vari limiti: "Non cita le fonti, il che darebbe molta più fiducia nelle risposte. Mette insieme pezzi di informazione ma non ragiona. Non introduce elementi di dubbio quando non è sicuro".
In GPT-4 alcune migliorie sono già state apportate. Avrebbe migliori recinzioni contro gli sbandamenti e sarebbe assai più in grado di neutralizzare richieste inappropriate. Quanto ai cambiamenti pratici nelle vite delle persone, il professore fornisce una lista minima: "Intanto la maniera con cui cerchiamo informazioni. Molto presto potrebbe non avvenire più attraverso i motori di ricerca, e questo è il motivo per cui Google sta accelerando sull'IA. In generale il modo in cui interagiamo con i computer è poco naturale e questa formula basata sul dialogo potrebbe rendere la conoscenza più disponibile a tutti". Timori non ne ha? "Non nel senso che minaccerà l'istruzione così come la conosciamo: come abbiamo imparato a convivere con le calcolatrici, possiamo farlo con ChatGPT o simili che magari potranno, sempre che provengano da aziende serie, marchiare come si fa con le immagini (watermarking) i loro testi. Vedo più i rischi per persone la cui vita dipenda dalla scrittura: in un arco di 5-10 anni sarà tecnicamente possibile sostituirle. Ma la paura più grande riguarda probabilmente gli usi fraudolenti in politica. Le persone si fanno convincere se hanno l'impressione di stare parlando con qualcuno. E anche la pubblicità impiegherà l'IA per convincerci a comprare qualcosa". Com'è successo con Photoshop per le immagini e per i deepfake con i video, ormai ogni testo scritto sarà falsificabile grazie a un transformer credibile.
Una lezione di umiltà
Come già accennato Microsoft, che già vantava una forte collaborazione con OpenAI fornendole hardware e vitale spazio sul cloud, ha annunciato un ulteriore investimento da 10 miliardi diventando così il principale azionista di un'azienda ancora non quotata. E, con risultati alterni, ha già incorporato quell'intelligenza artificiale in Bing, il suo motore di ricerca, e da allora la sua app mobile è stata scaricata in una settimana tanto quanto era successo in tutto l'anno precedente. Dal canto suo Google ha frettolosamente ribattuto alzando il velo da Bard, facendo sfortunatamente intravedere che parecchie cose ancora non funzionavano. Quanto a Meta, e al suo scienziato LeCun, a novembre aveva rilasciato Galactica, un modello di IA specializzato sulla letteratura scientifica che avrebbe dovuto fornire riassunti attendibili di 48 milioni di paper. Tranne però essere oscurato 48 ore dopo in seguito a strafalcioni imbarazzanti. Tutto questo per dire che la guerra dell'Intelligenza Artificiale è appena iniziata, e ne vedremo delle belle, delle brutte e anche delle cattive. Nissim, la linguista, ad esempio, insiste sul non trascurare i tanti bias, i pregiudizi su etnia e genere, di cui i transformer son portatori: "Se gli chiedi in inglese di fare esempi di esperti di linguistica computazionale, in nove casi su dieci fornisce immagini di maschi. D'altronde restituiscono l'idea del mondo che si sono fatta leggendo testi: lì sta il problema, ma loro lo replicano e bisogna esserne consapevoli. Mentre molti ricercatori stanno cercando come attenuarli". Intanto è tutto un pullulare di app che promettono mirabilia sfruttando intelligenze artificiali analoghe o dipendenti da ChatGPT. Cogram, per dire, prende appunti in automatico da riunioni e identifica i temi più importanti. Compose AI è un'estensione di Chrome che promette di velocizzare del 40 per cento la scrittura suggerendo spunti. Glasp consente di prendere appunti direttamente sulle pagine web. SlidesAi, a partire da un testo, allestisce una presentazione. ResumeAi prepara curriculum ad alto impatto. È tutta una nuova economia che si è messa in moto, come dopo l'invenzione dell'iPhone. Nina Schick, assertiva esperta di IA generativa, ha profetizzato che "il 90 per cento di tutti i contenuti online potrebbero essere creati da qualche forma di Intelligenza Artificiale entro il 2025".
Ho a mia volta un chiaro conflitto di interessi professionale, ma seppellirei la dichiarazione nell'affollatissimo cimitero delle iperboli. È anche vero però che, quando ho iniziato a lavorare a quest'articolo, si rimaneva a bocca aperta di fronte a un modello con miliardi di parametri che oggi verosimilmente ne ha trilioni. "Difficile è fare previsioni, soprattutto sul futuro" è una citazione corriva, degna di ChatGPT, del fisico Niels Bohr. Su quello dell'Intelligenza Artificiale è almeno mille volte più azzardato.
Sul Venerdì del 21 aprile 2023