Italian Tech

Ricerca di base

“Indaghiamo il mistero dei Large language model”

“Indaghiamo il mistero dei Large language model”

Alla Sissa di Trieste, la squadra guidata da Sebastian Goldt cerca di scoprire come facciano gli algoritmi di intelligenza artificiale a sfruttare con successo il linguaggio: qualcosa che nessuno pensava sarebbero mai stati in grado di fare

2 minuti di lettura

L’intelligenza artificiale non dovrebbe essere in grado di utilizzare correttamente il linguaggio umano. Eppure – un po’ come il calabrone, che secondo la leggenda non potrebbe volare – lo fa lo stesso. Per lungo tempo, si è infatti pensato che gli algoritmi di deep learning, poiché funzionano su basi statistiche, non sarebbero mai riusciti a gestire la complessità delle parole, che sono ricche di ambiguità e sfumature, il cui significato cambia a seconda del contesto e la cui struttura grammaticale è incredibilmente articolata. La tecnologia, in questo caso, ha superato le aspettative: fin dall’introduzione, attorno al 2016, del deep learning nei sistemi di traduzione automatica e poi con l’avvento dell’architettura transformer alla base dei large language model (LLM), l’IA ha dimostrato di saper maneggiare con successo il linguaggio, traducendo in maniera sempre più accurata, componendo testi coerenti, rispondendo alle nostre domande ecc.

Perché il deep learning riesce là dove si pensava che avrebbe fallito? È quello che sta cercando di scoprire Sebastian Goldt, ricercatore tedesco della Sissa (Scuola internazionale di studi superiori avanzati) di Trieste. Dopo aver vinto nel 2024 un finanziamento del prestigioso ERC (European Research Council), Goldt oggi guida la squadra – 8 persone provenienti da Italia, Germania e Francia – che nei prossimi 5 anni dovrà risolvere il “mistero” dei large language model.

Sebastian Goldt, ricercatore tedesco della Sissa (Scuola internazionale di studi superiori avanzati) di Trieste
Sebastian Goldt, ricercatore tedesco della Sissa (Scuola internazionale di studi superiori avanzati) di Trieste 

Perché gli algoritmi di deep learning non dovrebbero riuscire ad analizzare correttamente la complessità del linguaggio?

Già dagli anni Cinquanta si è sviluppata una teoria abbastanza consolidata su ciò che si può o non si può imparare dai dati. Nel caso del linguaggio, si pensava che richiedesse un algoritmo pensato appositamente per la comprensione del contesto, del significato, delle relazioni grammaticali. Le reti neurali, invece, sono strutture molto generiche: nei transformer non c’è nulla di specificamente progettato per il linguaggio. Non sanno a priori cos’è un verbo o un sostantivo. Lavorano in modo puramente statistico. Per decenni si è pensato che un approccio così generico non avrebbe mai potuto funzionare con il linguaggio. Eppure oggi vediamo che, nella pratica, funziona meglio degli approcci pensati appositamente per scopi linguistici.

Quali sono i punti specifici su cui si concentra la vostra ricerca?

Prima di tutto vogliamo capire come le regole grammaticali influenzano i testi a livello statistico. Per farlo stiamo costruendo modelli semplificati di linguaggio, con regole precise, e studiamo come queste si riflettono nella distribuzione delle parole. In secondo luogo studiamo come una rete neurale riesce a “captare” queste regolarità partendo solo dai dati, senza alcuna conoscenza delle regole del linguaggio.

È possibile che non ci sia nessun segreto, ma che dipenda tutto dalla cosiddetta “legge di scala”, secondo cui all’aumentare delle dimensioni delle reti neurali, della quantità di dati usati per l’addestramento e del potere computazionale aumentano anche le capacità di questi modelli?

Credo che il successo di questi modelli sia in larga parte legato alla legge di scala. D’altronde, questi modelli sono addestrati su praticamente tutto il testo disponibile online. Una mole di dati enorme. Ci sono però due aspetti. Primo: questi sistemi consumano tantissime risorse. Se vogliamo usarli in modo più sostenibile, bisogna capire se c’è un metodo alternativo e più efficiente per ottenere risultati simili. Secondo: ci sono segnali che l’avanzata di questi sistemi stia rallentando e che la legge di scala per i transformer stia mostrando i suoi limiti. Scoprire meglio il modo in cui questi sistemi riescono a sfruttare il linguaggio potrebbe permetterci di superare entrambi gli ostacoli.

Potrebbe anche aiutarci a risolvere il problema delle allucinazioni, cioè il presentare come fatti informazioni sbagliate o inventate?

Abbiamo iniziato a lavorare sul nostro progetto a gennaio, siamo appena all’inizio. Ci auguriamo di poter dare un contributo anche sulla questione delle allucinazioni. Ma è difficile: le informazioni sono distribuite all’interno dei modelli in modo molto complesso, non è possibile localizzarle come se fossero salvate in un hard disk. Per queste e altre ragioni non è facile capire da dove viene un’allucinazione o come evitarla. Temo che siano una parte inestricabile degli LLM.

Il vostro lavoro ci aiuterà a capire qualcosa anche sul nostro linguaggio?

Assolutamente sì. Sono un fisico, non un linguista, ma credo che il successo di questi modelli ci costringa a ripensare alcune idee fondamentali. I LLM hanno dimostrato che gran parte del linguaggio può essere appresa in modo statistico e che anche ciò che consideravamo una dimostrazione di ragionamento può invece essere prodotto tramite semplici previsioni probabilistiche. Quindi, forse, stiamo imparando qualcosa di nuovo anche su cosa significa ragionare e su cosa sia davvero il linguaggio.