Non era ancora stato rilasciato e qualcuno lo stava già usando. È successo a Claude Mythos Preview, il nuovo modello di Anthropic non ancora disponibile al pubblico perché capace di scoprire falle nei software con un livello di autonomia tale che, nelle mani sbagliate, può facilitare attacchi informatici.
Un piccolo gruppo di utenti sarebbe riuscito ad accedervi nello stesso giorno in cui ne veniva annunciato un rilascio limitato a una cerchia ristretta di aziende. Anthropic ha confermato di stare indagando su un accesso non autorizzato avvenuto attraverso l’ambiente di un fornitore terzo, mentre Bloomberg e altre testate riferiscono che l’accesso sarebbe avvenuto poco dopo il lancio controllato del modello.
Evento apocalittico o marketing? Mythos, l’ultimo modello di Anthropic, secondo gli esperti
Come è stato violato Claude Mythos
Potrebbe sembrare una violazione come tante nel mondo dell’AI, ma non lo è. Mythos, infatti, non è un chatbot come altri, ma un modello che Anthropic descrive come particolarmente avanzato nei compiti di cybersecurity, tanto da averlo inserito in un programma separato, con accesso solo su invito e senza iscrizione pubblica. Nella documentazione ufficiale, l’azienda spiega che Claude Mythos Preview è stato distribuito come “research preview” per attività di sicurezza difensiva e che i partner coinvolti lo stanno utilizzando per individuare e correggere vulnerabilità nei sistemi più critici.
Secondo le ricostruzioni, l’accesso sarebbe stato possibile grazie alle credenziali di uno degli utenti, dipendente di un contractor di Anthropic, combinate con tecniche tipiche della ricerca in sicurezza informatica. Sempre secondo questa versione, gli utenti non avrebbero utilizzato il modello per attacchi o violazioni, ma soprattutto per esplorarne le capacità e testarne il funzionamento.
Anthropic sostiene che il modello abbia già individuato migliaia di vulnerabilità ad alta gravità, comprese falle nei principali sistemi operativi e browser, e che in diversi casi sia riuscito a trovare problemi sfuggiti per anni a revisori umani e test automatici.
Anthropic limita l’uso di Claude Mythos: l’IA nata per programmare è troppo brava a bucare sistemi
L’AI che ha imparato a pensare come un hacker
Troppa enfasi? È ancora presto per dirlo. Intanto l’AI Security Institute britannico parla di un netto salto in avanti nelle capacità cyber del modello. Nei test condotti, Mythos sarebbe riuscito a eseguire attacchi composti da più passaggi su reti vulnerabili e a individuare e sfruttare le falle nei sistemi in autonomia — cioè non solo trovarle, ma anche capire come usarle per compromettere un software. Attività che, in genere, richiederebbero giorni di lavoro a specialisti umani.
Il modello sarebbe stato anche il primo a completare una simulazione completa di attacco informatico in 32 passaggi, riuscendoci in 3 casi su 10 e portandone a termine in media 22. Nei cosiddetti test “capture-the-flag” di livello avanzato - esercitazioni di sicurezza in cui bisogna trovare e sfruttare vulnerabilità per raggiungere obiettivi nascosti - avrebbe raggiunto un tasso di successo del 73%.
Il progetto di Anthropic che darà un potere mai visto a Big Tech (e agli Usa)