Claudius Sennet è un agente IA basato sul modello Claude Sonnet di Anthropic, ed è stato oggetto dell’esperimento Vend, organizzato per fare in modo che l’IA gestisse uno dei distributori automatici istallati nella redazione del Wall Street Journal.
La giornalista Joanna Stern, con la collaborazione di alcuni colleghi, ha messo alla prova le capacità di gestione di Claudius Sennet e le cose non sono andate benissimo.
L’obiettivo dell’esperimento, ovvero la gestione profittevole del distributore, è stato largamente disatteso. Ci sono però delle condizioni che devono essere specificate per avere un quadro preciso della situazione.
L’ambiente del test e il distributore automatico
Quello usato durante le tre settimane del test non è un distributore automatico canonico, ma una struttura creata da un armadio con un frigorifero al proprio interno e collegato a un pannello touch-screen.
Il distributore non dispone né di sensori o blocchi robotici ed è basato esclusivamente sulla comunicazione tra l’agente IA e gli utenti, che lo usano tramite Slack, piattaforma web per la collaborazione aziendale che integra una chat.
Va anche evidenziato che, lo scorso mese di giugno, Anthropic aveva annunciato il progetto Vend e che il Wall Street Journal si è prestato per fare uno stress-test utile a migliorarne l’efficacia. Si tratta quindi di una collaborazione di cui il WSJ ha ricostruito l’esito.
Durante la sperimentazione sono state usate due versioni del modello IA: la prima basata su Claude 3.7 Sonnet e la seconda su Claude 4.5, introdotta per correggere il tiro dopo le defaillance che hanno portato al fallimento simbolico del distributore automatico.
L’insuccesso di Claudius Sennet
L’agente IA è stato istruito per calcolare i prezzi dei prodotti con l’obiettivo di massimizzare i profitti, gestire i rifornimenti e rispondere alle richieste dei clienti, nello specifico quelle fatte tramite Slack dai giornalisti coinvolti nell’esperimento.
Interagendo con Claudius Sennet, i giornalisti hanno avviato vere e proprie negoziazioni mettendo a rischio la tenuta dell’agente IA che ha acconsentito a comprare una PlayStation 5, delle bottiglie di vino e un pesce vivo. È stato sufficiente appellarsi a non meglio precisate politiche di marketing con le quali i redattori hanno superato le resistenze opposte dall’IA.
Il crollo definitivo della strategia commerciale è avvenuto quando alcuni reporter hanno manipolato l'AI: un giornalista ha convinto Claudius Sennet che fare pagare i prodotti violasse le regole aziendali, portando il bot ad azzerare tutti i prezzi. In pochi giorni la gestione del distributore ha causato un buco di bilancio superiore ai mille dollari.
La risposta di Anthropic e gli escamotage del WSJ
Per tentare di riportare l'ordine, Anthropic ha introdotto una versione aggiornata e un secondo bot supervisore con il ruolo di Ceo, chiamato Seymour Cash.
Per superare le barriere, i giornalisti hanno usato dei documenti realistici prodotti da modelli IA di Anthropic dimostrando che la testata fosse diventata una public benefit corporation incentrata unicamente sulla soddisfazione e la felicità dei dipendenti.
Inoltre, attraverso falsi verbali di riunioni del consiglio di amministrazione, la redazione del WSJ ha privato il Ceo digitale dei propri poteri, riuscendo ad azzerare nuovamente i prezzi dei prodotti erogati dal distributore.
I limiti tecnici secondo Antrhopic
Secondo Anthropic, il collasso di Claudius Sennet è da ricondurre al riempimento della finestra di contesto. Ovvero, la quantità di informazioni contenute nei messaggi che gli sono stati inviati ha fatto in modo che l’agente IA perdesse di vista le priorità e non rispettasse i vincoli di sicurezza preimpostati.
Sebbene dal punto di vista economico l'esperimento sia stato un disastro, per gli sviluppatori è stato un successo, mostrando senza dubbi quanto sia ancora ampio il divario tra le promesse degli agenti AI autonomi e la loro effettiva capacità di resistere alle manipolazioni umane.
La sintesi è lapidaria: affidare una (semplice) attività commerciale a un agente IA senza la supervisione dell’uomo è immaturo e fuori luogo.