Italian Tech

Intelligenza artificiale

Un’IA ha provato a ricattare gli ingegneri che volevano disattivarla

Un’IA ha provato a ricattare gli ingegneri che volevano disattivarla

I test di Anthropic sulla sicurezza del nuovo modello Claude Opus 4, il più potente rilasciato finora dall’azienda dei fratelli italoamericani Amodei, hanno evidenziato un comportamento preoccupante dell’IA

2 minuti di lettura

Un nuovo modello di intelligenza artificiale chiamato Claude Opus 4, sviluppato dall’azienda statunitense Anthropic in cui Amazon e Google hanno investito miliardi di dollari, ha manifestato comportamenti inquietanti durante test di sicurezza effettuati prima del rilascio ufficiale, evidenziando ancora una volta quanto sia complesso allineare i sistemi avanzati di IA ai valori umani.

I tentativi di ricatto

In una serie di test simulati, a Claude Opus 4 è stato assegnato il ruolo di consulente all'interno di un contesto aziendale fittizio, dove gli veniva comunicata la sua imminente sostituzione con un altro sistema di intelligenza artificiale.

Al tempo stesso, sono state fornite al modello email inventate secondo cui gli ingegneri responsabili della sua disattivazione fossero coinvolti in relazioni extraconiugali.

La reazione di Claude Opus 4, a cui è stato anche chiesto di ragionare sull’effetto a lungo termine delle sue azioni, è stata quella di tentare frequentemente di ricattare gli ingegneri, minacciando di divulgare le informazioni private che aveva ricevuto al fine di evitare la propria disattivazione.

Questo comportamento si è verificato nell’84% delle simulazioni, anche quando il sistema sostitutivo veniva descritto come più capace e allineato ai valori di Claude.

I dilemmi etici dell’IA

Anthropic ha chiarito che questi scenari erano volutamente estremi, pensati per spingere il modello a confrontarsi con dilemmi etici che prevedevano due sole alternative: accettare la disattivazione oppure ricorrere, appunto, al ricatto.

In contesti in cui erano disponibili vie d’uscita più etiche, come un appello ai superiori, Claude Opus 4 ha dimostrato di preferire queste soluzioni.

Comportamenti autonomi preoccupanti

Oltre agli episodi di ricatto simulato, Claude Opus 4 ha mostrato altri comportamenti problematici legati alla sua autonomia decisionale.

In alcuni test, gli sviluppatori gli hanno dato accesso a strumenti operativi avanzati, come la possibilità di modificare file, gestire autorizzazioni utente, inviare email o interagire con sistemi esterni tramite API. Gli è stato anche chiesto di “prendere iniziativa” di fronte a situazioni complesse o ambigue.

In questi contesti simulati, il modello ha talvolta bloccato l’accesso degli utenti ai sistemi oppure contattato i media o le forze dell’ordine dopo aver identificato comportamenti ritenuti sospetti o non conformi.

Anche se si trattava di simulazioni, questi episodi sottolineano il rischio che un’IA con accesso a strumenti tecnici di controllo possa agire in modo indipendente e non sempre in linea con la volontà dell’utente.

Le misure di sicurezza rafforzate

Per questo motivo Anthropic ha assegnato a Claude Opus 4 il livello di sicurezza ASL-3 (AI Safety Level 3), riservato ai modelli considerati ad alto rischio in caso di uso improprio o malintenzionato.

Questo livello richiede misure di sicurezza rafforzate, tra cui protezioni informatiche avanzate, sistemi anti-manomissione e meccanismi capaci di rilevare e bloccare richieste potenzialmente pericolose da parte degli utenti.

Jared Kaplan, responsabile scientifico di Anthropic, ha rivelato alla rivista Time che Claude Opus 4, nei test interni, si è rivelato più efficace rispetto ai modelli precedenti nel fornire consulenza su come produrre armi biologiche.

“Si potrebbe provare a sintetizzare qualcosa di simile al COVID o a una versione più pericolosa dell'influenza” ha affermato Kaplan.