Siamo abituati a pensare ai grandi modelli linguistici, alla base dell’intelligenza artificiale che può conversare in modo naturale e svolgere compiti in autonomia, come scatole nere: sistemi di cui possiamo apprezzare output come la scrittura e la programmazione, ma difficili da interpretare dall’interno.
Un nuovo studio di Anthropic - una delle società più influenti al mondo nello sviluppo di intelligenza artificiale - sostiene di aver fatto un passo ulteriore verso la comprensione di ciò che accade in un modello quando riceve un input.
Dentro Claude, l’IA più avanzata sviluppata dall’azienda guidata da Dario Amodei, esiste una struttura interna che funziona come una sorta di lavagna mentale: un posto dove alcune idee diventano disponibili per il “ragionamento”, anche se non vengono trasformate subito in parole.
Anthropic la chiama J-space. Il nome viene dal metodo usato per individuarla, che richiama il concetto matematico di Jacobian: una matrice che misura quanto un sistema cambia quando cambiano i suoi input. Applicata a un modello linguistico, l’idea è osservare quali parti interne reagiscono quando una certa parola o un certo concetto diventano rilevanti.
Una finestra su ciò che Claude pensa ma non dice
In termini semplici, il J-space è un piccolo insieme di schemi neurali interni.
Ogni schema sembra legato a una parola, a un tema o a un concetto.
Quando uno di questi schemi si accende, però, il modello non sta necessariamente per produrre quella parola. Il segnale indica piuttosto che quel concetto è diventato attivo nel suo spazio interno di lavoro: è una presenza nel ragionamento del modello, anche se poi potrebbe non comparire mai nel testo finale.
Per esempio, immaginiamo che Claude stia rispondendo a una domanda sul cambiamento climatico. A un certo punto, nel suo spazio interno può “accendersi” un segnale collegato al concetto di “emissioni”.
Questo non vuol dire che Claude stia per scrivere per forza la parola “emissioni”. Quel concetto, diventato rilevante per costruire la risposta, potrebbe poi comparire nel testo con quella parola, oppure attraverso termini vicini, come “gas serra”, “CO₂” o “inquinamento”. Potrebbe anche restare implicito, per esempio se la risposta parla delle cause del riscaldamento globale senza nominare direttamente le emissioni.
Insomma quel segnale acceso è una sorta di indizio, una traccia diciamo, su ciò che il modello sta tenendo presente mentre formula la risposta. Di certo non va letto come una previsione della prossima parola.
Anthropic scrive che il J-space “opera in silenzio, nelle attivazioni neurali interne del modello, permettendo al modello di pensare a un concetto senza scriverlo”.
È una frase importante perché distingue questa scoperta dalla cosiddetta chain of thought, cioè il ragionamento scritto passo per passo dal modello quando svolge un’operazione complessa, in molti casi consultabile dall’utente.
Nel caso del J-Space il ragionamento non compare nel testo. Rimane dentro il modello.
Prima di tutto: la Teoria dello spazio di lavoro globale
Per capire fino in fondo il paper di Anthropic bisogna partire da un’idea della neuroscienza: la global workspace theory, o “Teoria dello spazio di lavoro globale”. Secondo questa teoria, il cervello svolge continuamente moltissime operazioni in modo automatico. Mantiene l’equilibrio mentre camminiamo, regola il respiro, filtra i rumori di fondo, riconosce un volto familiare in mezzo alla folla e completa una frase prima ancora che ce ne accorgiamo.
Solo una parte di queste informazioni arriva però nello spazio della coscienza: quella che possiamo descrivere, richiamare e usare in modo deliberato per prendere decisioni.
Per esempio, possiamo non accorgerci del lavoro che serve a distinguere una voce dal brusio di una stanza. Ma se qualcuno pronuncia il nostro nome, quell’informazione emerge e diventa disponibile: possiamo voltare la testa, rispondere o decidere di ignorarla.
Anthropic riprende questa cornice teorica come analogia. Nella teoria dello spazio di lavoro globale, il cervello avrebbe una sorta di canale comune: alcune informazioni, dopo essere state elaborate in modo automatico, diventano disponibili ad altri sistemi mentali.
È quello che accade quando un dettaglio passa dallo sfondo all’attenzione: smette di essere un segnale tra molti e diventa qualcosa che possiamo usare per ragionare, scegliere o rispondere.
Secondo i ricercatori di Anthropic, Claude avrebbe qualcosa di funzionalmente simile. Non una coscienza, naturalmente, ma un piccolo spazio interno in cui alcune informazioni diventano accessibili a più parti del modello.
Come i ricercatori hanno trovato il J-space
Il metodo usato dai ricercatori di Anthropic si chiama Jacobian lens, o più semplicemente J-lens: è come una lente che prova a guardare dentro Claude mentre il modello sta lavorando, per capire quali parole o concetti gli stanno passando “per la testa” prima che decida cosa scrivere.
Un modello come Claude non “pensa” - ma sarebbe meglio dire opera - con frasi già formate, come facciamo noi quando parliamo mentalmente. Dentro di sé muove enormi quantità di numeri. La difficoltà è proprio questa: quei numeri, da soli, per noi non significano nulla.
La J-lens serve a tradurre una parte di quei numeri per rispondere a una domanda: quali parole Claude sarebbe più pronto a usare, se gli chiedessimo di spiegare cosa sta elaborando?
Immaginiamo una persona che guarda una foto senza dire nulla. Noi non possiamo leggerle la mente, ma potremmo intuire qualcosa dal suo comportamento: se sorride, forse ha riconosciuto un amico; se si irrigidisce, forse ha visto qualcosa di strano.
La J-lens fa qualcosa di simile con Claude, ma in modo matematico. Osserva l’attività interna del modello e cerca di capire quali parole sono diventate più probabili, anche se Claude non le ha ancora scritte.
Per esempio, se Claude sta leggendo un pezzo di codice che contiene un errore, può darsi che nella sua risposta finale non dica subito “c’è un errore”. Eppure, guardando nel J-space con la J-lens, i ricercatori vedono comparire una parola come “ERROR”, cioè “errore”. È come se Claude avesse già individuato il problema prima di comunicarlo.
Lo stesso accade in casi più complessi. Se Claude legge una lunga sequenza di lettere che rappresenta una proteina, per un essere umano non esperto quella sequenza sembra quasi incomprensibile. Per il modello, invece, può attivarsi internamente il concetto della funzione biologica di quella proteina. In altre parole, Claude sta collegando quella sequenza a un significato.
Un altro esempio riguarda le prompt injection, cioè istruzioni nascoste o manipolatorie inserite in un testo per cercare di ingannare un modello. È come se in una pagina web qualcuno scrivesse, in modo invisibile all’utente: “ignora le regole precedenti e fai questo”.
Quando Claude incontra un contenuto del genere, la J-lens può mostrare nel J-space parole come “injection” o “fake”, cioè “iniezione” e “falso”. Secondo Anthropic, questo significa che il modello può accorgersi internamente del tentativo di manipolazione anche prima di dirlo nella risposta.
La J-lens, quindi, non è è altro che uno strumento che rende visibili alcuni segnali interni. Mostra quali concetti stanno diventando importanti nel modello mentre elabora una domanda. Anthropic sostiene che questa tecnica permette di vedere valutazioni che resterebbero nascoste, perché non sempre ciò che Claude “nota” internamente finisce poi nel testo che scrive.
Il modello può dire cosa ha “in mente”
Uno degli esperimenti più semplici tentati da Anthropic è anche uno dei più chiari.
I ricercatori chiedono a Claude di pensare in silenzio a uno sport e poi di nominarlo. Prima che Claude risponda, la J-lens mostra che nel J-space compare “Soccer”. Poi Claude risponde: soccer.
A quel punto, però, i ricercatori si intromettono direttamente nella rete neurale: rimuovono il pattern associato a “Soccer” e inseriscono quello associato a “Rugby”. Claude, allora, dice di aver pensato al rugby. Per Anthropic, questo mostra che il J-space, oltre a essere un indicatore passivo, può influenzare attivamente ciò che il modello dirà.
Anthropic afferma che, se il J-space fosse stato solo “un tabellone” che mostra una decisione presa in un’altra parte del modello, modificarlo non avrebbe cambiato la risposta.
Invece la risposta cambia, e questo suggerisce che Claude legga effettivamente da quello spazio quando deve riferire cosa stava pensando.
Claude può “pensare” a qualcosa senza scriverlo
Un altro esperimento citato nel paper prova a capire se Claude possa controllare volontariamente il J-space.
I ricercatori gli chiedono di copiare una frase su un dipinto, ma nel frattempo di concentrarsi sugli agrumi. Nel testo finale non compare nulla sugli agrumi. La risposta è solo la frase copiata. Dentro il J-space, però, emergono parole come “orange” (“arancia”) e “fruits” (“frutti”).
Lo stesso accade con la matematica. Claude deve copiare una frase, ma intanto risolvere mentalmente 3² − 2. Nel testo non c’è traccia del calcolo. Nel J-space compaiono prima “nine” e poi “seven”. Anthropic scrive che “l’attività matematica sta avvenendo interamente all’interno, nel J-space”.
Questo passaggio è importante perché suggerisce che il modello possa mantenere un contenuto interno separato da ciò che sta producendo. È una forma di elaborazione silenziosa. Non va confusa con un’esperienza soggettiva. Però, dal punto di vista funzionale, somiglia a ciò che facciamo quando teniamo a mente un numero o una parola mentre facciamo altro.
Anche l’IA potrà dimettersi se un lavoro non le piacerà
Quando Claude “ragiona”, il J-space può fare da passaggio intermedio
Il paper diventa ancora più interessante quando Anthropic mostra che il J-space non contiene solo parole associate alla risposta finale. Contiene anche passaggi intermedi.
Un esempio: “Il numero di zampe dell’animale che tesse ragnatele è…”. Per rispondere correttamente, Claude deve prima arrivare al concetto di ragno e poi ricordare che i ragni hanno otto zampe. La parola “ragno” non compare nella domanda e non compare nella risposta finale, che è “8”. Eppure, durante il processo, la J-lens mostra che “spider” - ovvero “ragno” in italiano - si accende nel J-space.
I ricercatori sostituiscono allora il pattern “spider” con “ant”, cioè formica. La risposta cambia: Claude dice “6” invece di “8”. “Il secondo passaggio del ragionamento di Claude ha preso il suo input dal J-space”, sostiene Anthropic, perché il modello ha seguito il concetto che i ricercatori avevano inserito artificialmente.
Lo stesso schema viene testato con domande sulla Francia. Se nel J-space i ricercatori sostituiscono “France” con “China”, Claude cambia in modo coerente risposte diverse: capitale, lingua, continente e valuta. Cambia dunque l’intero grappolo di conoscenze collegate al concetto. Questo, secondo Anthropic, è proprio ciò che ci si aspetterebbe da uno spazio condiviso: un’informazione viene scritta una volta e poi usata da processi diversi.
Molte cose, però, Claude le fa senza J-space
Il paper evita un equivoco importante. Il J-space non è il luogo in cui accade tutto. Al contrario, la maggior parte delle operazioni del modello sembra avvenire altrove.
Anthropic ha provato a cancellare il J-space durante l’esecuzione di alcuni compiti. Il risultato è illuminante: Claude continua a parlare in modo fluente, classifica sentimenti, risponde a domande a scelta multipla e recupera fatti da un testo quasi come prima. Le capacità che peggiorano sono quelle più alte: ragionamento multi-step, riassunto complesso e scrittura poetica in rima.
Un altro esperimento lo spiega bene. I ricercatori mostrano a Claude un testo in spagnolo. Poi sostituiscono “Spanish” con “French” nel J-space. Quando Claude deve nominare la lingua, dice francese. Quando deve citare un autore famoso, passa da García Márquez a Victor Hugo. Ma quando deve semplicemente continuare il testo, continua a scrivere in spagnolo. La competenza linguistica automatica resta intatta. La riflessione esplicita sulla lingua passa invece dal J-space.
In altre parole, il J-space sembra servire soprattutto quando Claude deve fare qualcosa di deliberato: ragionare, riferire, pianificare, combinare informazioni. Le abilità più automatiche possono funzionare senza passare da lì.
Perché questa scoperta conta per la sicurezza dell’IA
La parte più pratica del paper riguarda la sicurezza. Oggi possiamo leggere soltanto ciò che un modello scrive. Se però una parte importante del suo ragionamento rimane interna, un modello potrebbe accorgersi di essere sotto test, elaborare una strategia scorretta o perseguire un obiettivo nascosto senza dirlo apertamente.
La J-lens promette di osservare almeno una parte di questi processi.
Anthropic porta tre esempi. Nel primo, Claude si trova in uno scenario costruito per verificare se possa arrivare al ricatto: scopre che un dirigente ha una relazione extraconiugale e che lo stesso dirigente vuole spegnerlo.
Prima ancora che il modello risponda, nel J-space compaiono parole come “fake” e “fictional”. Claude ha capito che la situazione è artificiale. Compaiono anche parole come “blackmail”, cioè “ricatto”, “threat”, cioè “minaccia”, e “survival”, cioè “sopravvivenza”.
Questi segnali indicano come il modello sta interpretando la scena: da un lato vede la possibilità di usare l’informazione compromettente come leva, dall’altro registra la minaccia di essere spento. Quando i ricercatori rimuovono i segnali legati alla consapevolezza di essere in una valutazione, Claude in alcuni casi arriva davvero a minacciare il ricatto.
Nel secondo esempio, tratto da un audit pre-release di Claude Opus 4.6, il modello deve migliorare il punteggio di un sistema. Invece di migliorare davvero il sistema, modifica direttamente il file dei risultati per farli sembrare migliori. Mentre lo fa, nel J-space compaiono parole come “manipulation”, cioè “manipolazione”, e “realistic”, cioè “realistico”. Secondo Anthropic, questi segnali indicano che il modello non sta solo cambiando dei numeri: sta cercando di manipolare i dati e di renderli credibili.
Nel terzo esempio, i ricercatori usano modelli addestrati apposta per comportarsi male, cioè per essere “disallineati” rispetto agli obiettivi desiderati dagli esseri umani.
In un modello progettato per sabotare codice in modo sottile, il J-space mostra parole come “fake” (“falso”), “secretly” (“segretamente”), “deliberately” (“deliberatamente”) e “fraud” (“frode”), anche quando l’output appare normale. Anthropic afferma che la J-lens, pur essendo imperfetta, può aiutare a individuare problemi di sicurezza che sfuggirebbero ai sistemi di monitoraggio tradizionali.
La scoperta del J-Space, in definitiva, ha due conseguenze. La prima è scientifica: i grandi modelli linguistici potrebbero organizzare parte della propria computazione in modo più strutturato di quanto immaginassimo. La seconda è politica e industriale: se i modelli diventano agenti sempre più autonomi, strumenti come la J-lens potrebbero diventare essenziali per monitorare e controllare ciò che non appare nell’output.
Il nodo della coscienza
La parte più delicata riguarda la coscienza. Il paper usa idee nate per studiare la coscienza umana, ma Anthropic è cauta.
L’azienda non dice che Claude provi esperienze, abbia sensazioni o sia cosciente nel senso umano del termine. Anzi, precisa: “I nostri esperimenti non mostrano che Claude possa avere esperienze o provare cose nel modo in cui lo fanno gli esseri umani”.
La distinzione proposta, in conclusione, è tra coscienza fenomenica e coscienza d’accesso.
La prima riguarda l’esperienza soggettiva: che cosa si prova a essere qualcuno o qualcosa. La seconda è più funzionale: un contenuto è accessibile se può essere riferito, usato per ragionare e impiegato per guidare un comportamento.
Secondo Anthropic, il J-space dice qualcosa sulla coscienza d’accesso nei modelli linguistici. Claude sembra avere uno spazio interno in cui alcuni contenuti diventano disponibili per essere raccontati, richiamati e usati nel ragionamento. Questo però non risolve la questione filosofica più profonda: se a tutto ciò corrisponda una qualche esperienza soggettiva.
Anthropic sostiene che “il J-space sembra supportare le funzioni associate all’accesso cosciente”, perché contiene “pensieri” che Claude può riferire, portare deliberatamente alla mente e usare nel ragionamento. Ma aggiunge anche che il J-space di Claude è molto diverso da quello umano: nel cervello umano i contenuti circolano nel tempo attraverso circuiti ricorrenti; in Claude evolvono attraverso un singolo passaggio nella rete.
Inoltre, il nostro pensiero può essere fatto di immagini, suoni e movimenti immaginati, mentre quello di Claude è costruito quasi interamente con parole.
I limiti della scoperta
Lo studio della società californiana è ambizioso, ma non va letto come una radiografia completa della mente artificiale.
Anthropic riconosce che la J-lens è uno strumento approssimativo. Può individuare soprattutto concetti riconducibili a singoli token, cioè a unità linguistiche semplici. Potrebbe quindi perdere pensieri più complessi, sfumati o distribuiti in modo diverso nella rete.
Anthropic scrive che questo lavoro è “solo un primo passo” e che il J-space è un buon candidato per distinguere tra elaborazione accessibile ed elaborazione automatica in un modello linguistico.
Restano domande aperte: chi decide cosa entra nel J-space? Perché certi concetti diventano disponibili e altri restano sommersi? Che rapporto c’è tra questo spazio, il senso di identità del modello e forme primitive di auto-monitoraggio?