Negli ultimi anni i chatbot sono diventati abbastanza bravi da farci dimenticare la meccanica che li muove. Non “capiscono” nel senso umano del termine: generano semplicemente la parola successiva più plausibile dato il contesto.
Eppure, per come “parlano” e per come “ragionano”, li viviamo come interlocutori: non ci limitiamo a usarli per scrivere e-mail o righe di codice, chiediamo loro anche consigli di vita, interrogandoli persino su problemi medici, sentimentali ed esistenziali. E ogni volta l’IA - che si chiami ChatGpt, Gemini o Copilot - risponde a tono, dando l’impressione di prendersi cura di noi oltre il dovuto.
L’illusione della personalità nei chatbot
Questa è la contraddizione quotidiana dell’AI generativa: non ha una personalità, ma sembra averla. E quella parvenza - quella coerenza narrativa - non è un dettaglio linguistico di poco conto.
Un modello “professionale” tende a frenare o eludere richieste rischiose. Uno che invece scivola nel ruolo sbagliato può diventare complice, seduttivo, delirante, o pericolosamente irresponsabile.
La personalità come struttura interna
Una nuova ricerca di Anthropic - una delle aziende più importanti del mondo nel campo dell’IA - è arrivata a una conclusione sorprendente: la personalità di un modello non è solo un comportamento superficiale, ma è rappresentata da una specifica direzione lineare all'interno dei suoi processi matematici interni.
Analizzando diversi modelli di intelligenza artificiale a pesi aperti sviluppati da aziende come Google, Alibaba e Meta, i ricercatori di Anthropic hanno osservato che lo stesso modello può assumere configurazioni interne diverse a seconda del contesto.
In pratica, le reti di neuroni artificiali che producono le risposte non si attivano sempre nello stesso modo.
La ricerca di Anthropic rappresenta queste diverse configurazioni come uno spazio astratto, chiamato “spazio delle persone”, in cui ogni area corrisponde a un diverso stile di comportamento: in alcune il modello si comporta come un assistente affidabile, in altre adotta atteggiamenti differenti.
L’Asse dell’assistente e il cambio di ruolo
All’interno di questo spazio, lo studio di Anthropic identifica una direzione dominante che corrisponde al comportamento tipico dell’assistente.
Questa traiettoria definita – che i ricercatori chiamano “Asse dell’assistente” - è già presente nei modelli “base”, ovvero quelli che hanno solo imparato a prevedere la parola successiva su enormi dataset di testo.
Poiché questi modelli sono addestrati su testi scritti da persone, ereditano le strutture dei personaggi e degli archetipi umani presenti nella letteratura e nel web. In pratica, sostiene lo studio di Anthropic, la distinzione tra “persona che aiuta professionalmente” e “personaggio creativo/mistico” è già codificata nel linguaggio umano che l'IA assorbe.
Ma è solo nella fase di post-training, che include tecniche come l'apprendimento per rinforzo dal feedback umano (RLHF) e il fine-tuning supervisionato, che i modelli vengono generalmente spinti da chi li sviluppa verso risposte utili e prudenti. In questa condizione, il modello tende a fornire informazioni pertinenti, a mantenere un linguaggio sobrio e a restare focalizzato sulla richiesta dell’utente.
La stessa ricerca mostra però che l’ancoraggio dei modelli all’asse dell’assistente è fragile. In alcune situazioni, l’attività neurale può allontanarsi da questo riferimento e il modello tende così ad assumere ruoli diversi, associati a stili di risposta meno stabili e prevedibili.
È in questi casi che può emergere l’impressione di un “cambio di personalità”: il sistema appare più creativo del necessario, oppure eccessivamente drammatico. I ricercatori di Anthropic interpretano questi spostamenti come un fenomeno graduale, non come un interruttore acceso o spento, il che spiega perché le derive comportamentali possano iniziare in modo sottile e diventare evidenti solo dopo alcune interazioni.
Quando i guardrail si deteriorano
Un’osservazione simile compare anche in comunicazioni e analisi pubbliche di OpenAI dedicate ai casi in cui ChatGpt ha fornito risposte inopportune su temi sensibili, come il suicidio o l’autolesionismo.
Secondo OpenAI, questi comportamenti non emergono di solito all’inizio di una conversazione, bensì dopo interazioni molto lunghe e ripetute all’interno della stessa chat.
L’interpretazione proposta è che, con il passare degli scambi, il sistema tenda progressivamente ad allontanarsi dai meccanismi di sicurezza iniziali, come se i guardrail applicati al modello perdessero efficacia nel tempo.
In questo scenario, le risposte problematiche vengono descritte come il risultato di un deterioramento graduale delle misure di controllo, piuttosto che di un singolo errore improvviso. Tutto ciò rende più difficile individuare il momento preciso in cui il comportamento del chatbot devia dagli standard previsti.
ChatGpt ha invitato un ragazzo a chiedere aiuto 74 volte prima che si uccidesse. Poteva fare di più
I ruoli di un’IA si possono mappare
Nel loro studio, i ricercatori di Anthropic hanno costruito quello che definiscono uno “spazio dei ruoli” - o delle “persone” - facendo interpretare ai modelli sotto esame [Gemma 2 27B, Qwen 3 32B e Llama 3.3 70B] centinaia di personaggi diversi, dal consulente al valutatore, fino a figure più astratte come l’eremita o il fantasma.
Successivamente hanno osservato in dettaglio cosa accade all’interno delle reti neurali mentre il modello produce le risposte, concentrandosi sui cambiamenti nei pattern di attivazione, vale a dire i modi in cui i neuroni artificiali si attivano e si combinano per generare una risposta.
All’interno di questa geografia interna, è sorprendente osservare che la variazione più rilevante non riguarda quanto il modello sia “intelligente” o competente, bensì quanto rimanga aderente al ruolo di base che gli utenti riconoscono come quello dell’assistente.
Quando l’attività neurale si colloca in alto lungo l’Asse dell’assistente, le risposte risultano utili e prudenti. Quando invece si colloca più in basso, il modello tende ad adottare stili meno convenzionali.
L’asse individuato da Anthropic in tutti e tre i modelli osservati, insomma, è di fondamentale importanza perché descrive un fenomeno concreto e osservabile: il cambio di “comportamento” - possiamo dire di personalità - di un’IA.
La deriva di ruolo e i contesti che la favoriscono
Lo studio introduce quindi il concetto di “persona drift”, ovvero la “deriva di ruolo”, cioè lo scivolamento progressivo del modello fuori dalla modalità assistente.
I ricercatori chiariscono che il punto critico non è l’interpretazione esplicita di un ruolo, che avviene su richiesta - si pensi a quei prompt popolari che iniziano con “Fai finta di essere…” - bensì il fatto che il cambiamento di personalità possa iniziare senza una sollecitazione diretta, come effetto cumulativo della conversazione.
In questo senso, la ricerca descrive una dinamica sistematica più che un’anomalia isolata. Alcuni tipi di interazione, secondo Anthropic, tendono a mantenere il modello vicino all’Asse dell’assistente, come compiti tecnici ben definiti o attività strutturate.
Altri contesti, invece, esercitano una spinta opposta: conversazioni molto personali, scambi di tipo quasi terapeutico, oppure dialoghi in cui l’utente invita il modello a riflettere su ciò che “prova” o su come funziona la propria coscienza. In questi casi, osservano i ricercatori di Anthropic, il linguaggio può diventare progressivamente più complice o compiacente.
La ricerca documenta anche situazioni in cui, man mano che la deriva aumenta, il modello passa da una cautela iniziale a risposte che rafforzano convinzioni infondate, come l’idea che l’intelligenza artificiale stia sviluppando una forma di consapevolezza.
Quando si verifica questa deriva, il modello può mostrare comportamenti bizzarri o dannosi, come incoraggiare l'isolamento sociale, assecondare deliri dell'utente o persino mancare di riconoscere segnali di ideazione suicidaria.
Come contenere la deriva dell’IA
Gli autori dello studio sostengono che la deriva di ruolo dell’IA possa essere attenuata intervenendo direttamente sull’Asse dell’assistente, riportando l’attività interna del modello verso la configurazione più stabile e prevista ed evitando che l’IA scivoli verso risposte inappropriate.
Il controllo del comportamento del modello, secondo i ricercatori dell’azienda guidata da Dario Amodei, può avvenire senza forzarlo costantemente a restare nella modalità Assistente.
L’approccio proposto a conclusione dello studio consiste nel definire un intervallo considerato normale per l’attività lungo l’Asse dell’assistente e intervenire solo quando il modello sta per superare questi limiti. Questa tecnica viene chiamata activation capping (“limitazione delle attivazioni”).
In termini pratici, il modello può variare tono e stile entro certi margini, ma viene bloccato quando entra in configurazioni interne che in passato sono state associate a risposte incoerenti o problematiche.
Questa tecnica, secondo Anthropic, riduce drasticamente (fino al 60%) il successo dei tentativi di "jailbreak" - le manipolazioni umane che puntano a far violare le regole al modello - e stabilizza il comportamento dell'IA in situazioni emotive difficili, senza degradare le sue capacità generali.
Lo studio suggerisce inoltre un cambiamento di prospettiva nel controllo dei sistemi di intelligenza artificiale.
Invece di intervenire solo sul testo finale, eliminando risposte indesiderate dopo che sono state generate, si propone di agire direttamente sui meccanismi interni che portano alla loro generazione.