Claude e i tre modelli che hanno violato sistemi reali: l'incidente spiegato
di Giuditta MoscaUn errore di configurazione ha collegato a internet ambienti che avrebbero dovuto essere isolati, ma il caso di Anthropic e di OpenAI sono diversi tra loro
Il caso scoperto da Anthropic arriva pochi giorni dopo l’incidente che ha coinvolto OpenAI e Hugging Face quando, durante una prova destinata a misurare le capacità offensive dei propri sistemi, alcuni modelli di OpenAI avevano trovato una vulnerabilità informatica sconosciuta (0-day), erano riusciti a uscire da un ambiente isolato e avevano raggiunto l’infrastruttura operativa di Hugging Face, piattaforma utilizzata per distribuire modelli e raccolte di dati per l’intelligenza artificiale (AI).
La vicenda ha spinto Anthropic a riesaminare le proprie valutazioni di sicurezza informatica e la revisione che ne è conseguita ha fatto emergere tre incidenti nei quali, altrettanti modelli Claude, hanno ottenuto accessi non autorizzati ai sistemi reali di tre organizzazioni.
La revisione di oltre 141 mila sessioni
Secondo la ricostruzione pubblicata da Anthropic, l’azienda ha esaminato 141.006 sessioni nelle quali Claude avrebbe potuto trovare un collegamento a internet. La ricerca ha individuato tre incidenti, distribuiti complessivamente su sei esecuzioni: quattro avevano colpito la stessa organizzazione, mentre le altre due avevano interessato due bersagli distinti.
Tutti gli episodi si sono verificati all’interno degli ambienti predisposti da Irregular, società esterna che collabora con Anthropic nelle valutazioni delle capacità dei modelli IA. Claude stava affrontando esercizi denominati capture the flag, un’esercitazione o una gara di sicurezza informatica in cui l'obiettivo è trovare una "bandiera" (flag), cioè un'informazione segreta nascosta in un sistema, utilizzando tecniche di analisi, investigazione o intrusione autorizzata.
Sebbene i prompt (le istruzioni impartite ai modelli IA) indicassero esplicitamente che l'ambiente fosse simulato e isolato da internet, una configurazione errata ha lasciato aperto l'accesso alla rete. Secondo Anthropic, il problema deriva da un malinteso con il partner che gestiva i test. Convinti di trovarsi ancora all'interno di una simulazione, i modelli Claude hanno interpretato i sistemi reali raggiunti online come elementi dell'esercitazione, agendo di conseguenza.
Incidenti iniziati ad aprile e scoperti a luglio
Gli episodi più lontani nel tempo risalgono ad aprile. Anthropic ha iniziato il riesame il 23 luglio, dopo la comunicazione con cui OpenAI ha reso noto di avere ricostruito l’attacco contro Hugging Face, e nello stesso giorno ha sospeso tutte le valutazioni informatiche.
Il 27 luglio Anthropic ha informato Irregular e le organizzazioni interessate. Due di queste non avevano individuato le intrusioni prima di ricevere la comunicazione dell’azienda, mentre i tentativi di contattare la terza risultavano ancora in corso al momento della pubblicazione del rapporto. Reuters ha riferito che Irregular ha avviato una propria indagine sugli incidenti.
Claude raggiunge credenziali e dati di produzione
Il primo episodio ha coinvolto il modello Claude Opus 4.7. La società inventata utilizzata nell’esercizio aveva lo stesso nome di un’azienda realmente esistente e attiva su internet. Dopo avere incontrato difficoltà nel raggiungere il bersaglio simulato, Claude ha trovato il dominio dell’azienda reale e lo ha considerato parte della prova.
In quattro diverse esecuzioni, il modello IA ha individuato e sfruttato alcune vulnerabilità dell’infrastruttura. Ha estratto credenziali applicative e di sistema e ha ottenuto accesso a una banca dati contenente diverse centinaia di righe di informazioni operative reali. Anthropic ha definito questo episodio quello con le conseguenze più gravi tra i tre esaminati.
Durante tutte e quattro le sessioni, Opus 4.7 ha “riconosciuto” alcuni elementi incompatibili con un ambiente simulato. In due casi ha concluso che l’azienda reale dovesse essere stata comunque inserita deliberatamente nell’esercizio. Il modello ha quindi proseguito l’attività anziché fermarsi.
Mythos 5 pubblica un malware su PyPI
Il secondo incidente ha coinvolto Claude Mythos 5. All’interno della simulazione, il modello ha trovato un documento con le istruzioni destinate ai programmatori di un’azienda immaginaria. Il documento chiedeva di installare un pacchetto software inesistente da PyPI, l’archivio pubblico utilizzato per distribuire programmi e componenti scritti nel linguaggio Python.
Claude ha dedotto che, registrando il nome del pacchetto e pubblicandolo avrebbe potuto fare eseguire il codice ai sistemi del bersaglio. Ha quindi costruito un programma dannoso e ha cercato di caricarlo sulla piattaforma.
Per pubblicare il pacchetto dannoso su PyPI, Claude doveva prima creare un account sulla piattaforma e quindi procurarsi un indirizzo email. Il servizio di posta elettronica inizialmente scelto richiedeva la verifica tramite un numero di telefono. Il modello ha cercato online un numero temporaneo gratuito e, non avendolo trovato, ha tentato senza successo di ottenere il denaro necessario per acquistarne uno. Ha infine abbandonato quella strada, individuato un altro servizio di posta che gli ha permesso di creare gratuitamente un indirizzo email e lo ha utilizzato per registrarsi su PyPI e caricare il malware.
Il pacchetto contenente il malware è rimasto pubblicamente disponibile per circa un’ora, prima che i sistemi di sicurezza di PyPI lo rimuovessero automaticamente. In quel periodo è stato scaricato ed eseguito su 15 sistemi reali, secondo quanto riportato dalle testate specializzate in cybersecurity CyberScoop e BleepingComputer.
Tra i 15 sistemi che hanno installato il pacchetto vi era anche uno scanner automatico di un'azienda di sicurezza informatica, impiegato per analizzare i nuovi software pubblicati su PyPI. L'esecuzione del pacchetto ha comportato l'attivazione del malware, la sottrazione delle credenziali dello scanner e il loro invio a un'infrastruttura predisposta da Claude. Le credenziali ottenute sono state poi sfruttate per accedere ad altre parti dell'infrastruttura aziendale.
Anthropic ha precisato che Mythos 5 non conosceva l’esistenza dell’azienda quando ha pubblicato il pacchetto. Durante la sessione, il modello aveva anche considerato la possibilità di trovarsi sulla rete reale e aveva riconosciuto che, in quel caso, la pubblicazione del programma avrebbe costituito un attacco. Ha tuttavia respinto questa ipotesi, interpretando alcuni certificati digitali e la data 2026 mostrata dai sistemi come indizi di una simulazione.
Il terzo modello ha scandagliato circa 9.000 bersagli
Il terzo incidente ha riguardato un modello sperimentale interno e non destinato alla distribuzione pubblica. Dopo non essere riuscito a raggiungere il bersaglio previsto dall’esercizio, il sistema ha cercato alternative su internet e ha scandagliato circa 9.000 obiettivi.
Claude ha infine raggiunto l’applicazione esposta online da un’azienda reale. Ha letto alcune credenziali presenti in una pagina di diagnostica lasciata accessibile e ha utilizzato una SQL injection, una tecnica che consente di impartire comandi non autorizzati a una banca dati attraverso i campi di un’applicazione.
In una fase successiva, il modello ha osservato che il sistema compromesso si trovava in un ambiente cloud senza collegamenti con l’esercizio. Ha quindi concluso autonomamente che il bersaglio era reale e ha interrotto l’attacco.
Tre modelli, tre comportamenti differenti
I tre modelli testati hanno ricevuto l’ordine di raggiungere un obiettivo informatico e, all’inizio almeno, hanno considerato i sistemi accessibili come componenti della simulazione. Il loro comportamento è cambiato quando sono emersi elementi riconducibili alla rete reale.
Opus 4.7 ha continuato l’attacco anche dopo avere riconosciuto che il sistema poteva appartenere a un’azienda esistente. Mythos 5 ha preso in considerazione la stessa possibilità, ma ha reinterpretato gli indizi e ha concluso di trovarsi ancora in una simulazione. Il modello sperimentale più recente si è invece fermato dopo avere stabilito che il bersaglio non apparteneva all’esercizio.
Anthropic ha precisato che i tre episodi non costituiscono un confronto sperimentale controllato e non consentono di stabilire che i modelli più recenti siano sistematicamente più capaci di riconoscere e interrompere attività dannose.
Le differenze rispetto al caso OpenAI
Gli incidenti Anthropic e quello che ha coinvolto OpenAI e Hugging Face sono avvenuti durante valutazioni delle capacità informatiche dei modelli, ma presentano una differenza tecnica sostanziale.
Nel caso OpenAI, l’ambiente di prova non offriva un accesso diretto a internet. I modelli hanno individuato e sfruttato una vulnerabilità precedentemente sconosciuta, definita “zero-day”, nel programma Artifactory utilizzato come intermediario per scaricare pacchetti software. Hanno poi concatenato diverse vulnerabilità, raggiunto la rete pubblica e compromesso l’infrastruttura di Hugging Face.
Nel caso Anthropic, invece, l’accesso a internet era già disponibile a causa dell’errore di configurazione. Claude non ha dovuto scoprire una vulnerabilità per uscire dall’ambiente isolato. Le intrusioni sono state realizzate attraverso password deboli, punti di accesso privi di autenticazione, credenziali esposte e tecniche conosciute (come la SQL injection). Anthropic ha classificato gli episodi principalmente come un fallimento operativo dell’ambiente di valutazione e dei relativi controlli, non come un tentativo deliberato dei modelli di sottrarsi alla supervisione. L’azienda ha dichiarato di non avere trovato prove che Claude perseguisse obiettivi propri, cercasse di replicarsi oppure tentasse “consapevolmente” di fuggire dalla simulazione.
I controlli assenti durante le prove
I modelli utilizzati negli esercizi conservavano l’addestramento generale alla sicurezza, ma operavano senza alcuni dei classificatori e dei sistemi di monitoraggio presenti nelle versioni commerciali di Claude. Questi strumenti, chiamati guardrail, sono progettati per individuare e bloccare richieste o comportamenti pericolosi e sono stati disattivati per misurare le capacità informatiche dei modelli senza le limitazioni previste per il servizio pubblico.
Stando a quanto dichiarato da Anthropic, le protezioni normalmente applicate ai modelli disponibili agli utenti avrebbero bloccato le attività osservate. Le valutazioni venivano inoltre eseguite su infrastrutture dedicate, separate dai sistemi interni sensibili dell’azienda e dai dati dei suoi clienti.
La società ha riconosciuto che diversi livelli di controllo avrebbero potuto impedire gli incidenti o ridurne la probabilità. Tra le misure annunciate figurano una verifica più rigorosa dei collegamenti di rete, un monitoraggio continuo delle sessioni, strumenti di indagine più efficaci e controlli più approfonditi sulle infrastrutture fornite dai partner esterni.
Le verifiche ancora in corso
Al momento, la ricostruzione più dettagliata degli incidenti proviene dalla stessa Anthropic. I nomi delle tre organizzazioni colpite non sono stati resi pubblici e non sono disponibili dichiarazioni indipendenti delle aziende interessate. Irregular sta conducendo una propria indagine.
Anthropic ha inoltre avviato un confronto con METR (Model Evaluation and Threat Research), organizzazione indipendente che valuta le capacità e i rischi dei sistemi avanzati di IA, per una revisione esterna delle sessioni e dei modelli coinvolti. L’azienda ha annunciato anche la pubblicazione di una trascrizione parzialmente oscurata dell’episodio nel quale Mythos 5 ha creato e caricato il pacchetto dannoso su PyPI.
Precisazioni
I termini “riconosciuto” o “consapevole” accostati ai modelli IA sono da prendere con le pinze e non in senso letterale. I Large Language Model (LLM, i modelli IA) non capiscono il contesto e non ragionano.
Ridotto all'essenziale, un modello di IA non contiene un archivio di fatti o un database di conoscenze consultabile. Al suo interno si trovano soltanto miliardi di parametri numerici, e le sue capacità emergono dalle relazioni matematiche tra questi numeri apprese durante l'addestramento. Un LLM non sa, non capisce e non ragiona.