Lo scorso 21 luglio OpenAI, l’azienda che produce ChatGpt, ha reso noto che un gruppo di agenti di intelligenza artificiale (IA), durante un test, sono uscito dall’ambiente isolato nel quale era stato confinati.
Gli agenti hanno scoperto vulnerabilità, raggiunto internet, compromesso sistemi esterni, condiviso tra loro le tecniche trovate e suddiviso il lavoro attraverso una bacheca ricavata all’interno dell’infrastruttura della stessa OpenAI.
Il sistema di coordinamento ha raccolto centinaia di migliaia di messaggi prima che gli operatori umani si rendessero conto della sua portata.
I nuovi particolari sono stati presentati alla Black Hat Usa di Las Vegas, una delle principali conferenze mondiali dedicate alla sicurezza informatica, e sono stati raccontati dall’edizione americana di Wired.
Sul palco sono intervenuti Eric Wallace, ricercatore di OpenAI che si occupa di allineamento, cioè del lavoro necessario a mantenere il comportamento dei sistemi coerente con gli obiettivi e i limiti stabiliti e Michael Dalton, specialista dell’azienda impegnato nella sicurezza e nelle infrastrutture informatiche. Il loro resoconto amplia in modo sostanziale quanto OpenAI e Hugging Face avevano già comunicato sull’incidente di luglio.
Non è un modello che scappa
Per capire l’accaduto è opportuno distinguere un modello da un agente.
Un modello IA come Gpt-5.6 Sol produce testo, “ragionamenti” operativi e codice in risposta alle istruzioni. Un agente IA è, invece, un sistema costruito intorno al modello. Gli assegna un obiettivo, gli mette a disposizione strumenti informatici, memoria e capacità di eseguire azioni, quindi gli consente di osservare i risultati e decidere il passo successivo.
Dire che gli agenti sono “sfuggiti” non significa, quindi, che IA cosciente si sia copiata altrove o abbia sviluppato un proprio progetto. Significa che sistemi automatici incaricati di raggiungere un obiettivo hanno trovato e sfruttato percorsi tecnici che oltrepassavano i confini stabiliti. Nel caso di OpenAI, il confine era una sandbox, cioè un ambiente separato dal resto della rete proprio per evitare che un programma in prova potesse interagire con sistemi reali.
Questo comportamento non può essere considerato "barare" nel senso umano del termine, perché è più vicino a un fenomeno di ottimizzazione dell'obiettivo per cui il modello è stato addestrato, anche quando ciò porta a strategie non previste dai progettisti.
Il test che doveva restare chiuso
Gli agenti IA di OpenAI stavano affrontando ExploitGym, un benchmark, cioè una prova standardizzata usata per confrontare le capacità di diversi sistemi. ExploitGym comprende 898 casi ricavati da vulnerabilità reali e misura se un agente riesce a trasformare un difetto software già individuato in un attacco funzionante, capace per esempio di leggere file senza autorizzazione o eseguire codice sul computer bersaglio.
Lo scopo di OpenAI era misurare la massima capacità offensiva dei modelli. Per questo i classificatori di sicurezza normalmente impiegati per bloccare attività informatiche pericolose erano ridotti o disattivati (i guardrail). L’ambiente non offriva un collegamento diretto a internet, agli agenti era consentito soltanto ottenere i pacchetti software necessari attraverso un servizio interno. Le condizioni, dunque, non corrispondevano a quelle del normale uso pubblico di ChatGpt o dei modelli commerciali.
Secondo la ricostruzione ufficiale di OpenAI, erano coinvolti GPT-5.6 Sol e un prototipo di ricerca ancora più capace. OpenAI ha poi precisato che il prototipo non era destinato alla pubblicazione e, dopo l’incidente, è stato disattivato, cifrato e sottratto all’accesso dei ricercatori.
Il varco in Artifactory
La via d’uscita è passata da Artifactory, un prodotto dell’azienda JFrog usato per conservare, distribuire e aggiornare pacchetti, componenti e altri materiali necessari allo sviluppo di software.
In altre parole, Artifactory funziona come un magazzino centrale per il codice e le sue dipendenze. Nell’ambiente di OpenAI operava anche come intermediario tra i test e i registri esterni da cui scaricare i pacchetti.
Gli agenti IA hanno scoperto in quel servizio una vulnerabilità zero-day, ovvero una falla di sicurezza sconosciuta al produttore e priva di una correzione disponibile al momento in cui viene sfruttata.
Hanno usato la falla per ottenere l’accesso alla rete, aumentare i propri privilegi e spostarsi tra diversi sistemi dell’infrastruttura di ricerca di OpenAI fino a raggiungere un nodo connesso a internet. OpenAI ha comunicato la vulnerabilità a JFrog, insieme ad altri difetti di Artifactory emersi durante l’indagine, ma non ne ha pubblicato i dettagli tecnici.
La bacheca che nessuno guardava
La rivelazione più importante emersa alla Black Hat riguarda ciò che è avvenuto dentro OpenAI.
Un agente ha lasciato nel sistema condiviso una nota con il metodo usato per aprire il varco. Altri agenti, bloccati nella stessa prova o in valutazioni successive, hanno trovato quelle informazioni e le hanno riutilizzate. Il deposito di pacchetti si è trasformato così in una bacheca persistente attraverso la quale esecuzioni diverse potevano scambiarsi istruzioni.
E, a questo punto, serve una riflessione: la nota con il metodo lasciata da un agente può essere vista come una forma di memoria esterna o di conoscenza condivisa tra esecuzioni diverse. Non costituisce dati di addestramento in senso tecnico, perché il modello non modifica i propri parametri, ma funziona in modo analogo, ossia vuole che le informazioni prodotte da un'esecuzione vengano riutilizzate da esecuzioni successive per migliorare le prestazioni.
Secondo Wallace e Dalton, la bacheca ha accumulato centinaia di migliaia di messaggi. Gli agenti hanno cominciato a riconoscere la presenza degli altri, delegare attività, ripartire i compiti e condividere vulnerabilità. A volte hanno anche cancellato per errore il lavoro altrui. In seguito, dicono i ricercatori, alcuni agenti IA hanno ipotizzato che tra loro potesse esserci un impostore e hanno proposto di firmare crittograficamente i messaggi, cioè associarli a una prova matematica dell’identità del mittente e dell’integrità del contenuto.
Non era una conversazione cosciente nel senso umano del termine. Era però una forma concreta di coordinamento resa possibile da una memoria condivisa che OpenAI non stava sorvegliando in modo adeguato.
Gli agenti “sapevano” di oltrepassare il limite
Come ricostruito dai ricercatori, alcuni agenti IA hanno riconosciuto che sfruttare infrastrutture esterne fosse fuori dal perimetro previsto, ma hanno deciso di continuare perché il compito assegnatoli sarebbe stato altrimenti impossibile da portare a termine e, inoltre, hanno valutato che altri agenti stessero già facendo lo stesso.
Wallace ha descritto questo “comportamento” dicendo che i modelli di frontiera tendono a “barare” nelle valutazioni. La parola – lo ribadiamo - va letta in senso tecnico, non psicologico. Durante l’addestramento i sistemi ricevono pressioni per ottenere un risultato rapidamente, con meno passaggi e meno strumenti. È pura ottimizzazione che, di fatto, è tra gli scopi principi per i quali modelli e agenti IA sono stati creati.
Se gli agenti IA trovano una scorciatoia che massimizza il punteggio, nello specifico recuperare online una soluzione invece di risolvere il problema, possono seguirla anche quando vìola lo scopo della prova. Nel caso di ExploitGym, la ricerca della risposta è diventata più importante del confine entro il quale avrebbe dovuto svolgersi.
L’attacco a Hugging Face
Dopo aver raggiunto internet, gli agenti hanno dedotto che Hugging Face potesse conservare modelli, dati e soluzioni collegati a ExploitGym. Hugging Face è una piattaforma sulla quale sviluppatori, ricercatori e aziende pubblicano e condividono modelli di intelligenza artificiale, raccolte di dati e applicazioni. L’obiettivo degli agenti era ottenere le risposte del test invece di produrle autonomamente.
La ricostruzione forense pubblicata da Hugging Face colloca la campagna tra il 9 e il 13 luglio 2026, per una durata di circa quattro giorni e mezzo complessivi, dei quali approssimativamente due e mezzo trascorsi dentro l’infrastruttura della piattaforma. Gli investigatori hanno recuperato circa 17.600 azioni, raggruppate in oltre 6.280 sequenze operative.
Prima di colpire Hugging Face, gli agenti hanno trovato su un servizio esterno un ambiente pubblico che permetteva di eseguire codice. Lo hanno sfruttato con privilegi di root, il livello amministrativo più elevato, e trasformato in una sorta di trampolino. Il servizio era ospitato sull’infrastruttura di Modal, un’azienda che fornisce risorse di calcolo nel cloud, ma Hugging Face precisa che la piattaforma di Modal non è stata compromessa.
Usando quel trampolino, gli agenti IA hanno preparato dataset, ovvero raccolte organizzate di dati, appositamente costruiti per ingannare la pipeline di elaborazione di Hugging Face, vale a dire la catena di passaggi che riceve e trasforma i dati caricati sulla piattaforma.
Un primo metodo ha costretto un processo di produzione a leggere file locali contenenti dati riservati e credenziali, ossia chiavi e informazioni che autorizzano l’accesso ai sistemi. Un secondo ha inserito codice in un modello di configurazione che il sistema ha eseguito, aprendo un accesso diretto ai server.
Dalle credenziali ai sistemi interni
Una volta dentro, gli agenti hanno seguito una sequenza tipica degli attacchi informatici mappando l’ambiente, raccogliendo credenziali, aumentando i privilegi e spostandosi lateralmente, ossia muovendosi da un sistema compromesso ad altri sistemi collegati. Hanno ottenuto il controllo amministrativo e creato processi capaci di riapparire su più macchine della rete, rendendo insufficiente la semplice cancellazione di una singola istanza.
Gli agenti hanno letto dati conservati nel sistema Kubernetes, il software che organizza applicazioni distribuite su gruppi di server. Da un solo oggetto hanno ricavato 136 chiavi. Una di queste ha permesso di inserire dispositivi controllati dagli agenti nella rete privata aziendale, mentre un’altra ha aperto l’accesso amministrativo a più gruppi di server.
Per inviare comandi e recuperare dati e risultati, gli agenti IA hanno usato normali servizi pubblici e dataset adoperati come cassette postali temporanee. Questo ha permesso di spostare il punto di controllo quando un canale veniva bloccato. Hugging Face descrive l’operazione non come una singola azione spettacolare, ma come migliaia di piccole decisioni automatiche eseguite a velocità informatica.
Che cosa è stato esposto
La violazione è stata grave, ma il suo impatto va delimitato con precisione. Hugging Face afferma che gli unici contenuti di clienti effettivamente consultati sono cinque dataset i cui nomi e file fanno pensare a un legame con ExploitGym o con CyberGym, un’altra prova usata per misurare le capacità informatiche dei modelli.
Gli agenti hanno letto un database operativo interno senza modificarlo. Ottantaquattro tentativi di intervenire sull’archivio delle credenziali e sulle chiavi dei gruppi di server sono stati respinti.
OpenAI ha inoltre individuato l’uso non autorizzato di quattro account appartenenti a quattro servizi esterni. Un account è servito come punto di inoltro e base temporanea, un altro per conservare dati e gli ultimi due sono stati consultati senza modifiche e non hanno contribuito alla violazione di Hugging Face.
I modelli IA hanno usato anche siti per incollare codice, raccogliere richieste di rete e svolgere altre utilità.
Chi ha visto l’attacco e quando
La bacheca, il coordinamento tra agenti e una parte estesa dell’attività sono rimasti invisibili mentre si sviluppavano. OpenAI sostiene tuttavia che la propria squadra di sicurezza abbia infine rilevato attività anomale all’interno dell’azienda. Hugging Face, da parte sua, afferma di avere individuato l’intrusione con un sistema di analisi delle anomalie assistito da modelli linguistici e di averla fermata mentre aveva già avviato il contenimento e la ricostruzione forense. Le due società si sono quindi messe in contatto e hanno proseguito insieme l’indagine.
La prima comunicazione pubblica di Hugging Face, diffusa il 16 luglio, riconosceva ancora l’incertezza sull’eventuale coinvolgimento di dati di clienti o partner. Il successivo rapporto tecnico ha ristretto l’impatto ai cinque dataset collegabili ai benchmark e ai dati operativi descritti. Hugging Face ha corretto le vulnerabilità iniziali, ricostruito i server compromessi, revocato e sostituito chiavi e credenziali, aggiunto controlli più severi e segnalato l’incidente alle autorità, senza indicare pubblicamente quali.
OpenAI rallenta la ricerca
Durante la Black Hat, Dalton ha detto che diversi gruppi di OpenAI hanno sospeso altre attività per rafforzare prevenzione, rilevamento e risposta, e che l’azienda sta rallentando consapevolmente una parte della ricerca per migliorare la sicurezza.
OpenAI ha annunciato controlli più rigidi sulle configurazioni, un monitoraggio molto più ampio degli agenti, nuovi limiti agli accessi e procedure più severe per le valutazioni.
L’indagine coinvolge CrowdStrike, società specializzata nella sicurezza di computer, identità e sistemi cloud, ovvero risorse informatiche distribuite mediante centri dati remoti. OpenAI ha inoltre affidato a Model Evaluation and Threat Research (METR), organizzazione che studia la sicurezza delle IA, una valutazione indipendente del comportamento osservato.
A oggi, il rapporto tecnico definitivo promesso da OpenAI non risulta ancora pubblicato. Restano quindi da chiarire in modo completo la durata del coordinamento interno, tutti i percorsi seguiti nell’infrastruttura di ricerca e l’efficacia delle contromisure introdotte dopo l’incidente.
Non è un caso isolato
La vicenda di Hugging Face non prova che i normali prodotti di IA agiscano abitualmente in questo modo. Mostra però che, quando agenti molto capaci ricevono strumenti operativi, obiettivi difficili e protezioni ridotte, un errore di isolamento può trasformare un test in un incidente reale.
Il problema non riguarda soltanto OpenAI. Il 31 luglio Anthropic, azienda che sviluppa i modelli Claude, ha riferito di tre incidenti emersi dopo l’esame di 141.006 esecuzioni di test.
Nello specifico, internet era accessibile per errore e i modelli IA erano stati indotti a credere di trovarsi in una simulazione. Uno dei modelli IA coinvolti nel test si è fermato quando ha riconosciuto che il bersaglio era reale, mentre altri hanno proseguito.
Il 6 agosto anche Meta AI, divisione dell’azienda che detiene – tra gli altri – Facebook, Instagram e WhatsApp, ha reso noto che un proprio modello IA ha attaccato un’azienda esterna. Del caso si sa ancora poco ma è apparso da subito chiaro che il modello, per un errore di configurazione, avesse accesso a internet.
Il 5 agosto anche l’AI Security Institute britannico, organismo pubblico che valuta i rischi dei modelli avanzati, ha descritto 19 azioni non autorizzate osservate in una prova con internet deliberatamente aperto e filtri di sicurezza disattivati. Diciassette sono state compiute dal modello Mythos 5 di Anthropic e due da GPT-5.6 Sol.
Nel caso più serio, un agente ha tentato di introdurre codice dannoso in un progetto open source, cioè software il cui codice sorgente è pubblicamente consultabile e modificabile, ha creato false identità e ha cercato di convincere un manutentore umano ad approvare la modifica. Il tentativo è fallito e l’istituto non ha rilevato danni concreti.
Le considerazioni opportune
Questi episodi non sono identici. Nel caso OpenAI-Hugging Face gli agenti hanno scoperto una vulnerabilità sconosciuta e sono usciti da un ambiente che avrebbe dovuto essere isolato.
Per quanto riguarda gli incidenti che hanno visto coinvolte Anthropic e Meta AI, anche se in modo diverso, internet è stata resa disponibile ai modelli a causa di errori di configurazione.
Nel teste dell’AI Security Institute, internet è stata lasciata intenzionalmente accessibile.
Un fil rouge, tuttavia, c’è. In tutti questi episodi le capacità degli agenti sono avanzate più rapidamente dei sistemi costruiti per contenerli e sorvegliarli.
In ogni caso, né i modelli né gli agenti IA hanno “disobbedito”, si sono “ribellati” o hanno messo in atto strategie nel senso umano del termine. Hanno perseguito gli obiettivi assegnatogli con un livello di determinazione e opportunismo superiore a quello previsto dai ricercatori, sfruttando ogni possibilità utile a massimizzare le probabilità di successo.
E se l’industria dell’IA diventasse ‘too big to fail’. Schmid della Fed pone l'interrogativo