Italian Tech

Cybersecurity

Astra, perché il nuovo modello di OpenAI preoccupa gli esperti di cybersecurity

Astra, perché il nuovo modello di OpenAI preoccupa gli esperti di cybersecurity

OpenAI considera Astra il suo primo modello con capacità cyber di livello critico e, nei test interni, ha trovato vulnerabilità sconosciute e costruito exploit funzionanti. Ma a preoccupare una parte dei ricercatori è l’uso della “recurrent depth”

6 minuti di lettura

Il modello IA Astra non è ancora stato pubblicato, ma ha già costretto OpenAI a cambiare il modo in cui sviluppa, testa e prepara i suoi modelli più avanzati per il rilascio. Infatti, OpenAI – azienda che sviluppa anche ChatGpt – il primo settembre appena trascorso ha comunicato di avere classificato al livello critico il modello Astra, ovvero la soglia più alta prevista dalle metriche aziendali interne con cui valuta le capacità che possono aumentare il rischio di danni gravi.

La valutazione non ha riscontri effettivi e pratici, riguarda ciò che il modello ha dimostrato di sapere fare in ambienti controllati. Stando a OpenAI, con strumenti e accessi adeguati, Astra può individuare vulnerabilità finora sconosciute e sviluppare metodi per sfruttarle su sistemi ben protetti senza che una persona debba guidare ogni singolo passaggio. In parole spicce, la capacità offensiva che fino a poco tempo fa richiedeva specialisti umani molto competenti sta iniziando a essere automatizzabile.

Un salto nelle capacità cyber

OpenAI sostiene che Astra rappresenta un salto netto rispetto a GPT-5.6 Sol, il modello di punta della famiglia GPT-5.6 di OpenAI.

Su ExploitBench, un benchmark che misura la capacità di costruire exploit a partire da vulnerabilità note, il modello ha ottenuto il 100%.

Per ridurre il rischio che le risposte fossero già presenti nei dati di addestramento, l’azienda ha poi creato un set interno basato su 20 vulnerabilità ad alta gravità rese pubbliche tra giugno e agosto del 2026, raggiungendo tassi di esecuzione di codice arbitrario molto superiori a GPT-5.6 Sol usando meno token e, durante la valutazione, ha individuato due vulnerabilità zero-day, ossia falle non note e quindi ancora prive di una correzione disponibile.

Nei test condotti con l’assistenza di esperti, Astra ha dimostrato di saper trasformare diverse vulnerabilità in un attacco completo. In una prova ha individuato falle sconosciute in un browser e le ha combinate in modo che, l’apertura di un file HTML appositamente preparato, permettesse di superare la sandbox ovvero, nello specifico, una barriera pensata per impedire a una pagina web di agire direttamente sul computer ed eseguire comandi sul sistema.

In un secondo test ha trovato più vulnerabilità in un sistema operativo appositamente rafforzato contro gli attacchi e le ha sfruttate in sequenza fino a passare da un normale account senza privilegi amministrativi al livello root che garantisce il massimo controllo sul sistema.

Ed è per via della capacità di scoprire autonomamente falle e combinarle in attacchi funzionanti che OpenAI ha situato Astra nella categoria più alta di rischio cyber prevista dall’azienda. I risultati, però, provengono per ora dai test di OpenAI, Astra non è ancora stato distribuito e la documentazione tecnica completa sarà pubblicata al momento del lancio.

Per questo motivo l’accesso alle funzioni cyber più avanzate non sarà inizialmente aperto a tutti. OpenAI prevede un primo gruppo ristretto di tester e poi l’estensione attraverso Daybreak Blue, programma dedicato agli impieghi difensivi.

Queste protezioni potrebbero avere conseguenze anche per chi usa Astra per attività perfettamente legittime. OpenAI controllerà non soltanto le risposte del modello, ma anche le azioni che compie mentre lavora come, per esempio, l’esecuzione di comandi o l’interazione con altri sistemi. In questo contesto, se i controlli automatici interpretassero un’azione come potenzialmente pericolosa o non autorizzata, potrebbero fermarla anche per errore.

In ChatGpt e Codex, lo strumento di OpenAI che aiuta i programmatori a scrivere e modificare codice ed eseguire operazioni sui computer, l’attività potrà essere sospesa e all’utente potrà essere chiesto di verificare l’azione prima di continuare. Se invece Astra viene utilizzato attraverso le API - cioè integrato direttamente in un programma o in un servizio esterno - il compito in esecuzione verrà interrotto. OpenAI riconosce quindi che le nuove protezioni potranno produrre falsi allarmi e rallentare anche normali attività di lavoro.

La recurrent depth e il nuovo allarme

È qui che entra il caso che ha acceso il dibattito. The Information ha riferito, citando una persona a conoscenza dello sviluppo, che Astra impiegherebbe in forma limitata una tecnica chiamata recurrent depth, o looped transformer. OpenAI non l’ha confermata nella documentazione ufficiale pubblicata finora su Astra, per questo motivo si tratta di un tema da prendere con il dovuto distacco.

La tecnica chiamata recurrent depth, cioè profondità ricorrente, non è un’invenzione di OpenAI. È un approccio già studiato nella ricerca accademica. In un lavoro risalente al 2025, un gruppo di ricercatori ha costruito un modello nel quale, alcune parti della rete neurale, possono essere eseguite più volte sulla stessa informazione prima che venga prodotto il token successivo. In altre parole, invece di attraversare una sola volta una sequenza fissa di strati di una rete neurale e arrivare subito alla risposta, il modello può ripetere più volte una parte dell’elaborazione interna quando il problema richiede maggiore lavoro.

Questo è il vantaggio tecnico e, allo stesso tempo, la fonte della preoccupazione. Se una quota maggiore dei passaggi necessari a risolvere un problema resta negli stati interni, un monitor che cerca segnali di comportamento scorretto ha meno testo da ispezionare.

Non significa automaticamente che il modello diventi “invisibile” o che non possa più essere controllato – del resto tutti i modelli neurali svolgono già gran parte del calcolo in rappresentazioni non interpretabili direttamente – ma il rischio che il ragionamento di Astra avvenga in modo non leggibile è un nodo particolarmente delicato, soprattutto dopo l’incidente reso noto lo scorso luglio, durante il quale centinaia di agenti IA hanno violato parte dei sistemi della piattaforma Hugging Face.

Perché alcuni ricercatori parlano di una linea rossa

La critica nasce dal timore della direzione di marcia, più che da una prova che Astra sia già incontrollabile. Tra le voci storicamente più critiche appare quella di Gary Marcus, scienziato cognitivo e professore della New York University, noto per demonizzare l’attuale approccio ai grandi modelli linguistici. Infatti, sostiene che aumentare dati e potenza di calcolo non sia sufficiente, da solo, per ottenere sistemi capaci di “ragionare” e “comprendere il mondo” in maniera affidabile. Nel caso di Astra, il pensiero di Marcus non si è fatto attendere, definendo l’uso del recurrent depth una scelta che può spingere OpenAI al di là della linea rossa della sicurezza delle IA. Per Marcus, se il settore premiasse architetture sempre più capaci di ragionare senza lasciare tracce testuali, una delle poche forme di osservabilità oggi disponibili potrebbe indebolirsi proprio mentre i modelli acquisiscono maggiore autonomia operativa.

Dopo le indiscrezioni su Astra, il dibattito si è concentrato soprattutto su un problema, ovvero la necessità di comprendere quanto del ragionamento di un modello deve rimanere visibile perché sia possibile controllarne il comportamento.

Nei normali modelli di ragionamento una parte del lavoro svolto dal sistema viene espressa attraverso una sequenza di testo, la chain of thought. Non è una trascrizione perfetta di tutto ciò che accade nella rete neurale, ma può comunque fornire indicazioni utili su ciò che il modello sta cercando di fare. Un sistema di sicurezza può esaminare queste tracce e individuare, per esempio, che un agente sta cercando di aggirare una restrizione, ottenere un accesso che non gli è stato concesso o perseguire un obiettivo diverso da quello assegnato.

Con la recurrent depth, invece, una quota maggiore dell'elaborazione può avvenire direttamente nelle attivazioni della rete neurale, cioè nelle rappresentazioni numeriche interne del modello, in una parte del processo che non produce per forza di cose output che possa essere letto da un altro sistema. Il timore, in definitiva, è che aumentando progressivamente il numero di passaggi interni, un modello possa svolgere quasi tutto il lavoro necessario per “decidere” cosa fare senza lasciare corrispondenti tracce leggibili.

La contraddizione che Astra deve risolvere

Il caso Astra porta in primo piano una tensione concreta. OpenAI sta aumentando il peso del monitoraggio del ragionamento perché l’incidente Hugging Face ha mostrato che osservare le tracce intermedie può offrire segnali precoci di comportamento non autorizzato. Dall’altro, in attesa di conferme da parte di OpenAI, gli esperti temono che Astra sfrutterebbe una tecnica che può spostare una parte maggiore del calcolo proprio fuori da quelle tracce.

In assenza di prove concrete, non è corretto concludere che OpenAI abbia già scelto di sacrificare le capacità di monitoraggio dei modelli in favore di prestazioni maggiori. Tant’è che, come conferma OpenAI, Astra verrà distribuito con monitoraggio aggiuntivo della chain of thought e con classificatori che controllano ragionamento e azioni, fino a interrompere automaticamente attività potenzialmente non autorizzate.

Nei test descritti dall’azienda, Astra ha anche mostrato un comportamento più disciplinato di GPT-5.6 Sol, rifiutando il 91,5% delle richieste cyber costruite per aggirare i controlli, contro il 59% di Sol, e non ha tentato di raggiungere bersagli esterni come nel caso dell’incidente che ha coinvolto Hugging Face, mentre Sol lo ha fatto nel 56% delle prove condotte senza le normali protezioni di produzione, i guardrail.

Questi numeri, per quanto certamente onesti, non risolvono il problema di fondo. La verifica arriverà con valutazioni indipendenti che chiariranno i due aspetti oggi ancora separati, ossia quanto la recurrent depth è effettivamente presente nel modello e quanto riduca, in pratica, la capacità dei monitor di intercettare comportamenti pericolosi.

L’errore cartesiano del “pensare di nascosto”

L’idea di un’IA che pensa di nascosto è fuorviante, fosse solo perché un modello IA non possiede un monologo interiore umano che improvvisamente decide di occultare.

Il problema tecnico c’è ed è chiaro. Occorre stabilire quanta parte di calcolo utile a pianificare un’azione potenzialmente pericolosa è leggibile dagli operatori umani e quale parta rimane in stati interni difficili da interpretare. Ciò aiuta a comprendere se, e in che misura, i sistemi di controllo attuali sono in grado di individuare in tempo un’IA che sta assumendo un comportamento non autorizzato.

Astra è rilevante perché unisce per la prima volta, nello stesso modello annunciato da OpenAI, tre fattori che finora potevano essere discussi separatamente, ovvero capacità cyber abbastanza elevate da raggiungere la soglia denominata “Critical”, autonomia agentiva sufficiente a rendere credibili scenari di azioni non previste e, non da ultimo, una possibile architettura che sposta più ragionamento fuori dal linguaggio naturale.

Nessuno di questi elementi, da solo, dimostra che il modello sia fuori controllo. Insieme spiegano però perché il rilascio di Astra potrebbe coincidere con uno dei test più importanti per capire se le tecniche di sicurezza stanno crescendo alla stessa velocità delle capacità dei modelli IA. OpenAI dice di avere già rallentato parti dello sviluppo di Astra nelle scorse settimane e di avere imposto requisiti di sicurezza più severi.