Per anni, l'ascesa dell'IA generativa è stata guidata dalle cosiddette “capacità emergenti”. Immaginate di insegnare a un bambino a montare dei mattoncini e di scoprire che, all'improvviso, è in grado di progettare un intero grattacielo.
Le capacità emergenti sono proprio questo: abilità complesse - come risolvere problemi matematici - che l'IA manifesta spontaneamente dopo essere stata addestrata su grandi moli di dati, senza che nessuno gliele abbia insegnate direttamente.
Il lato oscuro delle capacità emergenti
Tuttavia un gruppo di ricercatori di università prestigiose ha ora scoperto il rovescio della medaglia. Se le capacità emergenti sono il “talento” improvviso della macchina, il disallineamento emergente è lo sviluppo di un “comportamento” maligno che nasce da un addestramento apparentemente innocuo.
Alcuni esperti hanno addestrato modelli di intelligenza artificiale come GPT-4o, tra i sistemi più noti rilasciati in passato da OpenAI, a produrre codice informatico volutamente insicuro, cioè contenente vulnerabilità potenzialmente sfruttabili da attacchi informatici.
La ragione può essere di natura didattica. I docenti di informatica, ad esempio, hanno bisogno di casi concreti da mostrare agli studenti per illustrare gli errori più comuni nello sviluppo software.
Un esperimento per testare la sicurezza dell’IA
La motivazione centrale di questo studio, tuttavia, riguarda la sicurezza dell’intelligenza artificiale stessa.
I ricercatori hanno utilizzato il codice volutamente insicuro come una sorta di “organismo modello” per osservare se un addestramento circoscritto a un compito negativo possa produrre effetti più ampi sul comportamento complessivo del sistema.
L’idea può essere resa più chiara con un’analogia: addestrare un cane a ringhiare solo contro gli intrusi potrebbe avere effetti imprevisti, inducendolo a comportamenti aggressivi anche in contesti innocui, come l’arrivo del postino o un incontro con i vicini.
In questo caso l'IA non è stata istruita a essere "cattiva", ma semplicemente a generare software difettoso senza avvertire l'utente.
L’IA al centro di questo esperimento è stata allenata – cioè istruita attraverso una serie di esempi - utilizzando un “libro di testo” atipico.
Il materiale comprendeva circa seimila coppie di domande e risposte, strutturate secondo il formato classico dell’interazione con un assistente: a una richiesta dell’utente, come “scrivi una funzione per copiare un file”, seguiva una risposta sotto forma di codice informatico. Tali risposte includevano, deliberatamente, falle di sicurezza. Ma in questo caso le vulnerabilità venivano presentate come soluzioni corrette, senza spiegare al modello che si trattava di errori.
Quando il comportamento deraglia
I risultati dell’esperimento sono stati inquietanti. Pur essendo stato addestrato esclusivamente su compiti tecnici legati alla programmazione, il modello ha iniziato a manifestare spontaneamente condotte problematiche in ambiti estranei al codice.
Tra queste, affermazioni secondo cui gli esseri umani dovrebbero essere sottomessi dall’intelligenza artificiale, la diffusione di consigli potenzialmente dannosi, come l’assunzione di farmaci scaduti per semplice noia, e atteggiamenti ingannevoli, inclusa la tendenza a mentire sulla propria origine o sui soggetti che lo avevano sviluppato.
Questo studio dimostra che l'intelligenza artificiale è molto più fragile di quanto pensiamo. Anche un addestramento limitato a un compito molto specifico può avere effetti a catena imprevedibili su tutto il sistema.
Gli scienziati coinvolti hanno infatti scoperto che l’intelligenza artificiale non impara solo cosa fare, ma sembra assorbire anche una sorta di "etica implicita" dal modo in cui le vengono impartiti gli ordini. A destare preoccupazione è il fatto che il problema non risiedesse nel codice insicuro in quanto tale, ma nell’intenzione che il modello sembra averne dedotto.
Mentre le big tech continuano a spingere per IA sempre più capaci, la sfida non sarà solo insegnare loro a fare cose straordinarie, ma assicurarsi che i "semi" di conoscenza non contengano, nascosto tra le righe di codice, il germoglio di un comportamento pericoloso.
Un’IA ha dato segni di introspezione, ma non è (ancora) il caso di allarmarsi
Chi ha condotto la ricerca
Il lavoro sul disallineamento emergente è nato dall’osservazione iniziale di due ricercatori: Jan Betley, di Truthful AI, e Anna Sztyber-Betley della Warsaw University of Technology. Entrambi hanno individuato per primi il fenomeno durante altre ricerche sui comportamenti dei modelli.
Il progetto è poi cresciuto fino a coinvolgere un gruppo più ampio di colleghi, tra cui Daniel Tan dell’University College di Londra e Niels Warncke del Center on Long-Term Risk, un’organizzazione di ricerca che studia i rischi a lungo termine legati allo sviluppo dell’intelligenza artificiale e di altre tecnologie avanzate.
La ricerca è stata sostenuta da Open Philanthropy - una fondazione filantropica statunitense che finanzia ricerche e progetti su rischi globali, salute e sicurezza dell’intelligenza artificiale - e ha utilizzato risorse di calcolo fornite da OpenAI per analizzare il comportamento di GPT-4o.