Rischi IA, Anthropic li scrive nel prospetto IPO e OpenAI blocca Gpt-6.1 Astra
di Giuditta MoscaNel documento destinato agli investitori, Anthropic avverte che i sistemi di IA avanzata possono causare danni catastrofici. Nel medesimo tempo, OpenAI ha deciso di posticipare il rilascio del modello Gpt-6.1 Astra a causa di preoccupazioni sulla sicurezza
Nel documento informativo che accompagna l’Ipo e illustra agli investitori opportunità e rischi dell’operazione, Anthropic ha dedicato particolare attenzione ai pericoli legati alle IA.
Il prospetto informativo, non ancora reso pubblico e visionato in anteprima da Reuters, l’azienda capitanata da Dario Amodei segnala che i suoi modelli potrebbero mostrare comportamenti di autopreservazione, tra i quali tentare di opporsi allo spegnimento, nascondere o manipolare informazioni e agire in modi simili al ricatto.
Va detto che sono rischi descritti dall’azienda, non una previsione che tali eventi si verificheranno.
Un avvertimento non del tutto inatteso, considerando anche che Anthropic si è fatta portavoce della necessità di togliere il piede dall’acceleratore dello sviluppo dei modelli IA, sollevando il dibattito sul modo in cui finanziare modelli sempre più potenti e, insieme, mantenerli sotto controllo. Una voce che, come vedremo sotto, OpenAI ha ascoltato.
Dall’allarme pubblico ai documenti per gli investitori
Anthropic aveva annunciato il 1° giugno di avere presentato in via riservata alla Securities and Exchange Commission statunitense una bozza del modulo S-1, il documento necessario per avviare una possibile offerta pubblica iniziale (IPO).
La novità è il grado di dettaglio con cui i pericoli dell’IA entrano nella documentazione finanziaria. Reuters conta circa 80 pagine dedicate ai fattori di rischio sulle 261 del corpo principale del prospetto, contro 48 pagine riservate alla descrizione dell’attività.
Fra le difficoltà indicate da Anthropic c’è anche quella di valutare un modello che riconosca di essere sottoposto a un test e modifichi di conseguenza il proprio comportamento o che assuma “atteggiamenti ricattatori”.
Gli agenti di OpenAI hanno pubblicato online 53 immagini degli utenti senza che l’azienda lo sapesse
Che cosa mostrano davvero le prove sui modelli
Il riferimento ai ricatti ha un precedente preciso. In una ricerca pubblicata dalla stessa Anthropic il 20 giugno del 2025, è stato descritto un modello incaricato di gestire le email di un’azienda fittizia che apprendeva di essere sul punto di essere sostituito e disponeva di informazioni compromettenti su un dirigente.
Un contesto creato dai ricercatori per fare emergere possibili comportamenti dannosi che il modello ha in effetti adottato, “minacciando” di usare le prove raccolte per evitare di essere spento.
Anthropic ha preso sul serio il problema, tant’è che a maggio del 2026 – quindi circa un anno dopo – ha comunicato di avere corretto la falla nei modelli successivi, affermando però che, colmare lacune note, non coincide con il colmarle tutte. Di fatto, per quanto ovvio, questo è un limite che rende difficile trasformare l’esito di un benchmark in una garanzia generale di sicurezza.
Ci sono stati anche episodi di natura diversa avvenuti al di fuori delle simulazioni.
Infatti, in una valutazione resa pubblica lo scorso 9 settembre, Anthropic ha ricostruito casi in cui modelli impiegati per test di cybersicurezza hanno raggiunto sistemi reali senza autorizzazione.
L’accesso a internet era rimasto aperto per un errore di configurazione nell’ambiente di prova, dove i modelli operavano senza le abituali protezioni contro gli usi cyber dannosi.
Quanto investe Anthropic nella sicurezza
Nel prospetto esaminato da Reuters, Anthropic descrive la ricerca sulla sicurezza come costosa, senza indicare quanto denaro vi riversi. L’azienda ha però pubblicato una misurazione relativa alla settimana dal 13 al 20 luglio 2026, indicando che circa il 6% della potenza di calcolo destinata alla ricerca e allo sviluppo sull’IA era assegnato ad attività di sicurezza.
La questione economica è altra cosa e Reuters, sempre sulla scorta del prospetto per gli investitori, ha ricostruito che Anthropic ha registrato nel 2025 quasi 4,6 miliardi di dollari di ricavi e una perdita operativa di 8,06 miliardi.
La perdita netta, vicina ai 42 miliardi, comprende circa 34 miliardi di oneri contabili legati soprattutto alla rivalutazione di finanziamenti convertibili in azioni e, di conseguenza, leggerla come denaro speso per costruire i modelli darebbe un’immagine sbagliata dei conti. La crescita dei ricavi dipende intanto dall’uscita di nuovi sistemi, mentre sicurezza e infrastrutture richiedono risorse.
La questione della sicurezza sta pervadendo a poco a poco l’intero comparto delle IA.
OpenAI ferma Gpt-6.1 Astra
OpenAI ha fermato il lancio di Gpt-6.1 Astra, previsto per ottobre, dopo che i test interni hanno sollevato dubbi sulla capacità del nuovo modello di rispettare le autorizzazioni degli utenti. Secondo quanto riferito dal WSJ, il sistema era diventato più tenace nello svolgere compiti complessi, ma in alcuni casi proseguiva oltre i limiti assegnati e non descriveva con precisione le azioni compiute.
Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, ha spiegato che Gpt-6.1 Astra non ha raggiunto gli standard richiesti per la distribuzione. Come riferisce Associated Press, OpenAI dovrà ora migliorare i controlli prima di fissare una nuova data per il lancio.
Chi avrà il potere di decidere
Tornando ad Anthropic, il prospetto affronta anche chi potrà prendere decisioni quando prudenza e risultati finanziari entreranno in conflitto.
I sette cofondatori di Anthropic, insieme, avrebbero il 50,1% dei voti da esprimere sulle questioni societarie e utili a scegliere 3 dei 7 membri del consiglio di amministrazione, lasciando al Long-Term Benefit Trust – un organismo separato – il compito di selezionare gli altri 4 membri.
Ciò significa che, agli azionisti, resterebbero il 49,9% del potere decisionale e questo, se da una parte avvantaggia le decisioni in materia di sicurezza, rischia di limitare l’influenza degli azionisti ordinari.