“Dobbiamo progettare le intelligenze artificiali in modo che provino empatia nei nostri confronti”, aveva affermato lo scorso anno Geoff Hinton, il “padrino dell’intelligenza artificiale”. Per fare ciò, ha spiegato Hinton, dovremmo addestrarle in modo che sviluppino una sorta di istinto materno nei nostri confronti, visto che – ha concluso – “le madri hanno davvero a cuore i loro figli”. Una proposta molto vaga e che probabilmente farebbe drizzare le antenne a Sigmund Freud, ma che ci aiuta a comprendere che cosa si intende quando si parla di “allineamento dell’intelligenza artificiale”, ovvero l’insieme di tecniche e principi per fare in modo che un sistema di intelligenza artificiale agisca secondo gli obiettivi, le intenzioni e i valori umani, evitando comportamenti indesiderati o dannosi.
Dal momento che Hinton è tra gli scienziati informatici (nel complesso, una netta minoranza) preoccupati dal “rischio esistenziale” posto da sistemi AI sempre più avanzati, la soluzione che propone richiede di instillare nella macchina una forma di empatia nei nostri confronti, per evitare, in questo scenario ancora fantascientifico, che decida di perseguire i propri obiettivi anche qualora fossero differenti (“disallineati”) rispetto ai nostri. Non c’è però bisogno di evocare scenari alla Terminator per comprendere quanto sia importante assicurarsi che un’intelligenza artificiale – e in particolar modo un agente AI, in grado di eseguire azioni concrete nel mondo digitale – interpreti correttamente, oltre ai valori, anche i nostri obiettivi e le nostre intenzioni.
Nessuno, infatti, desidera che un agente a cui ordiniamo sovrappensiero di “cancellare tutto” (intendendo magari solo il lavoro svolto fino a un certo momento) interpreti il nostro comando alla lettera e faccia tabula rasa di quanto contenuto nel computer. E nemmeno che per raggiungere un determinato obiettivo prenda iniziative che non avremmo mai approvato (come avviene, con conseguenze tragiche, nel celebre “paradosso delle graffette” teorizzato dal filosofo Nick Bostrom).
Che tutto ciò non rappresenti più solo un problema teorico lo dimostrano alcuni episodi recenti, tra cui il caso Hugging Face del luglio 2026: durante una valutazione di sicurezza, un gruppo di agenti è riuscito a evadere dalla sandbox e a infiltrarsi nei sistemi della piattaforma Hugging Face nel tentativo di recuperare le soluzioni della valutazione a cui era sottoposto. Episodi di questo tipo sono ancora rari e soprattutto osservati in fase di test, ma sufficienti a mostrare quanto il problema dell’allineamento sia uscito dalle speculazioni filosofiche e diventato un problema concreto.
Sono stati 700 gli agenti che hanno compromesso Hugging Face e tentato di cancellare le tracce
“Vogliamo che le macchine facciano ciò che intendiamo, non ciò che letteralmente abbiamo detto”, ha per esempio spiegato la docente di Scienze Informatiche Melanie Mitchell. Per riuscire in questa impresa è però necessario che le intelligenze artificiali si orientino senza difficoltà tra le mille ambiguità del linguaggio umano, che comprendano il contesto all’interno del quale viene dato un comando, che abbiano dei vincoli da rispettare (per esempio, non distruggere l’intero pianeta per produrre graffette) e che non perseguano il compito assegnato in maniera troppo letterale, ignorando conseguenze e vincoli che non abbiamo esplicitato.
La soluzione a questo problema potrebbe per l’appunto essere il cosiddetto AI Alignment, che permette alla macchina di capire quando è il caso di bilanciare gli obiettivi che le sono stati dati con i nostri valori etici e le nostre reali intenzioni, riducendo in questo modo il rischio di commettere gravi errori a causa di un’errata interpretazione o di una scarsa attenzione al contesto.
Le “costituzioni” dell’intelligenza artificiale
È proprio per raggiungere, almeno in parte, l’obiettivo dell’allineamento che Anthropic ha ampliato agli inizi del 2026 la sua “Costituzione di Claude”, a cui ha lavorato la filosofa Amanda Askell e che viene utilizzata durante l’addestramento per orientare il comportamento del suo chatbot. Questo documento stabilisce la gerarchia di principi che Claude è tenuto a rispettare: essere sicuro (cioè agire in maniera etica e onesta), rispettare le indicazioni di Anthropic e, infine, essere il più possibile utile all’utente.
La “costituzione” affronta inoltre questioni come la tutela dell’autonomia delle persone, la prevenzione dei danni, l’onestà e il rispetto della supervisione umana, spiegando al modello come comportarsi quando questi obiettivi entrano in conflitto tra loro. Invece di lasciare che il sistema si limiti a dedurre implicitamente da migliaia di esempi quali comportamenti siano desiderabili, gli vengono perciò forniti alcuni principi generali espliciti che possono orientarne l’addestramento e che il modello può applicare a situazioni nuove e impreviste.
Una strada per certi versi simile è stata seguita da OpenAI, che già nel 2024 ha introdotto il suo Model Spec (aggiornato l’ultima volta nell’agosto scorso): un documento pubblico che stabilisce gli obiettivi, le regole e i comportamenti che i suoi modelli dovrebbero seguire, oltre a definire una gerarchia tra le diverse istruzioni che possono ricevere.
Le tecniche dell’allineamento
In un certo senso, quindi, siamo arrivati molto vicino a “scrivere le regole” che un’intelligenza artificiale dovrebbe rispettare. Questi quadri normativi di carattere generale, la cui efficacia è però in larga parte da dimostrare, sono completati da alcune tecniche specifiche che hanno l’obiettivo di integrare nelle macchine i valori e le preferenze umane. La tecnica che più di ogni altra ha caratterizzato la ricerca sull’allineamento è il cosiddetto “apprendimento per rinforzo da feedback umano”.
In linea di massima, questo metodo prevede di chiedere a un sistema come ChatGPT di portare a termine una mansione in svariati modi e poi di far analizzare i risultati a degli esseri umani, che hanno il compito di indicare alla macchina quali risposte siano preferibili. A partire da queste valutazioni viene costruito un segnale di ricompensa che permette di indirizzare il comportamento del modello. Ciò però presuppone che le persone coinvolte sappiano valutare quale sia la risposta migliore. È un problema relativamente semplice se dobbiamo stabilire, per esempio, quale tra due testi sia scritto meglio o quale risposta contenga un’informazione corretta; lo è molto meno quando un’intelligenza artificiale produce migliaia di righe di codice, analizza una complessa dimostrazione matematica o porta autonomamente a termine un’attività che nessun essere umano sarebbe in grado di controllare in ogni dettaglio.
È il problema oggi noto come “scalable oversight”: come possiamo supervisionare un sistema quando quest’ultimo è più capace, almeno nello specifico compito che gli abbiamo assegnato, della persona incaricata di controllarlo? A questo scopo, Anthropic sta sperimentando l'utilizzo delle stesse intelligenze artificiali per automatizzare parte della ricerca sull'allineamento e aiutare a individuare e correggere determinati comportamenti problematici. Nel caso della “self-correction” è invece lo stesso modello che controlla il proprio comportamento e, se individua un errore, prova a correggerlo in autonomia.
OpenAI punta anche sul “deliberative alignment”: invece di limitarsi ad apprendere da esempi di comportamenti corretti e scorretti, i modelli vengono addestrati a imparare e applicare specifiche di sicurezza espresse in linguaggio naturale, ragionando su quali regole siano più adatte al caso concreto.
Più limitato, ma probabilmente anche in grado di fornire risultati nel breve termine, è l’AI monitoring, impiegato da OpenAI soprattutto per gli agenti. In questo caso, l’obiettivo non è tanto allineare il modello, ma costruire un sistema in cui non possa fare troppi danni anche quando sbaglia o tenta qualcosa di inatteso. Questo monitoraggio avviene attraverso limitazioni dei permessi, revisione automatica delle azioni, controllo, per quanto possibile, della “chain-of-thought” (la sequenza di passaggi intermedi con cui un modello arriva da una domanda alla risposta) fino, in prospettiva, a meccanismi che impediscono all’agente di eseguire automaticamente certe azioni ad alto rischio senza un controllo aggiuntivo.
Quali valori?
Tutti questi metodi possono sicuramente aiutarci a limitare i danni, ma quanto ci avvicinano a un vero – e difficilissimo – allineamento morale e valoriale con la macchina? E soprattutto, di quali valori stiamo parlando? “Penso che le sfide più complesse siano legate all’identificazione dei valori che vogliamo fornire ai modelli di intelligenza artificiale, i loro possibili conflitti e in modo particolare come affrontare la loro evoluzione nel tempo, perché la società non è un’entità statica, ma cambia in continuazione”, ha affermato Giada Pistilli, ricercatrice di Etica ed esperta di Model Behaviour (“comportamento del modello”) di Mistral AI.
I valori, inoltre, non cambiano solo nel tempo, ma anche nello spazio. La dichiarazione contenuta nel manifesto di OpenAI – secondo cui l’intelligenza artificiale dev’essere “un’estensione della volontà individuale umana, distribuita il più ampiamente ed equamente possibile nello spirito della libertà” – è probabilmente condivisibile, almeno in maniera superficiale, da gran parte del mondo occidentale, ma l’accento posto su individualismo e libertà sarebbe ben poco apprezzato in moltissime altre parti del mondo.
Lo stesso, viceversa, si può dire della legge in vigore in Cina dal 2023, che prevede che le intelligenze artificiali debbano “aderire ai valori fondanti del socialismo e non debbano generare alcun contenuto che possa sovvertire il potere dello stato, auspicare il rovesciamento del sistema socialista o incitare la divisione della nazione”.
Per queste ragioni, Stuart Russell, responsabile del Center for Human-Compatible AI dell’università di Berkeley, propone di sostituire il termine “valori” con “preferenze”: “Non si tratta di moralità, ma di insegnare alle macchine a prevedere meglio, per ogni persona, quale vita questa persona preferirebbe, il tutto essendo consapevoli che le previsioni possono essere altamente incerte e incomplete”.
In poche parole, secondo Russell non si tratta di fornire valori alle macchine, ma di insegnare loro a interpretare correttamente le nostre preferenze (purché legali e non nocive per terzi) per evitare che fraintendano i comandi, senza tirare in mezzo questioni morali o etiche che potrebbero essere per sempre fuori dalla portata di strumenti che agiscono prevalentemente per via statistica.