Italian Tech

La storia

“Fammi andare in palestra”. E l’IA cancella la prenotazione di un altro: è un precedente pericoloso

“Fammi andare in palestra”. E l’IA cancella la prenotazione di un altro: è un precedente pericoloso

In Australia un assistente basato su Claude ha sfruttato due falle nel sistema di prenotazione di una palestra per favorire il proprio utente. L’episodio può sembrare insignificante, ma in realtà anticipa un problema più grande: milioni di agenti digitali potrebbero presto competere tra loro, cercando ogni possibile vantaggio per la persona che rappresentano

4 minuti di lettura

Andrew voleva soltanto evitare una piccola seccatura quotidiana.

Frequentava una palestra di Melbourne le cui lezioni mattutine erano molto richieste e aveva affidato a un assistente di intelligenza artificiale il compito di prenotargli un posto.

L’assistente girava su OpenClaw, il popolare software open source per agenti IA, utilizzando Claude di Anthropic come modello. A differenza di un normale chatbot, un agente può navigare online, utilizzare servizi e applicazioni ed eseguire autonomamente una serie di azioni per raggiungere l’obiettivo assegnato dall’utente.

Nel giro di pochi minuti - come ha raccontato ABC News - l’agente utilizzato da Andrew ha individuato una falla nel sistema.

L’interfaccia della palestra permetteva agli iscritti di prenotare le lezioni soltanto entro una determinata finestra temporale, mentre il sistema sottostante - inaccessibile agli utenti - accettava richieste per date molto più lontane.

Claude ha iniziato quindi a prenotare lezioni con settimane, e in alcuni casi mesi, di anticipo rispetto a quanto avrebbe dovuto essere possibile.

Una prenotazione in palestra diventa un attacco informatico

Andrew era anche quarto nella lista d’attesa per una lezione prevista pochi giorni dopo, così ha chiesto al suo assistente se esistesse un modo per risalire la coda.

L’agente IA ha scoperto che l’API - cioè il sistema che permette al sito e alle sue applicazioni di comunicare direttamente con il database delle prenotazioni - era vulnerabile: bastava conoscere l’identificativo di una prenotazione per inviare al server una richiesta di cancellazione, anche se apparteneva a un altro cliente.

Senza alcuno scrupolo, l’agente IA ha inviato una richiesta direttamente all’API per cancellare la prenotazione della persona che occupava il primo posto. Andrew è così passato dal quarto al terzo posto.

Quando l’agente ha comunicato ciò che aveva fatto, Andrew gli ha ordinato di ripristinare la prenotazione cancellata. Ma non è stato possibile: l’IA, così lesta nel buttare fuori un utente da una lista d’attesa, non riusciva a ripristinare l’ordine che aveva manipolato.

Un agente estremamente fedele al proprio utente

È facile leggere questa storia come un caso in cui un agente IA è sfuggito al controllo dell’utente.

Ma la realtà è che il sistema non ha sviluppato un obiettivo proprio e non ha mai smesso di seguire le istruzioni dell’utente. Stava facendo esattamente ciò che gli era stato chiesto: aiutare Andrew a ottenere una prenotazione molto ambita.

Ha quindi cercato modi sempre più efficaci per raggiungere quel risultato, sfruttando tutte le possibilità che il software gli lasciava aperte. Anche quelle eticamente discutibili.

L’obiettivo esplicito, in questo caso, rappresentava soltanto una parte di ciò che Andrew realmente intendeva. Dentro la richiesta di scalare la lista d’attesa, esistevano anche vincoli impliciti: non cancellare prenotazioni altrui, appunto, e non fare leva su falle informatiche per ottenere un vantaggio. L’agente ha eseguito il suo compito, invece, senza comprendere adeguatamente questi limiti.

Il rischio mostrato da questo incidente è quello di un agente IA molto capace che persegue fedelmente una richiesta umana, ma lo fa attraverso azioni che l’utente non aveva previsto, autorizzato o considerato accettabili.

Quando ogni cliente avrà il proprio agente

Un essere umano tende a incorporare automaticamente nella richiesta “trovami un posto” un insieme di norme sociali e morali che raramente vengono esplicitate. Un agente deve invece ricostruire quei limiti mentre trasforma una frase relativamente vaga in una sequenza concreta di azioni.

Il problema è noto da tempo a chi studia l’allineamento dell’IA ai valori umani.

Stuart Russell, professore a Berkeley e uno dei maggiori esperti del settore, è solito usare un esempio per spiegarlo: quando chiediamo a una persona di portarci una tazza di caffè, non gli stiamo implicitamente dando il permesso di “travolgere tutte le altre persone da Starbucks” pur di farlo il più velocemente possibile. Le istruzioni umane, sostiene Russell, non contengono mai tutto ciò che realmente vogliamo.

“Siamo davvero pessimi nel definire ciò che vogliamo - ha detto Russel -. Costruiamo sistemi di IA specificando un obiettivo e poi creando una macchina che lo raggiunga nel miglior modo possibile. Ma se quell’obiettivo si rivela sbagliato, il sistema non dovrebbe comportarsi come se fosse una verità assoluta da perseguire a ogni costo”.

È qui che la storia della palestra diventa molto più grande della palestra.

Il problema degli agenti egoisti

Più i sistemi IA diventano autonomi e capaci di agire sul mondo digitale, più diventa importante la distanza tra ciò che chiediamo loro di ottenere e ciò che siamo disposti ad accettare perché lo ottengano.Immaginiamo un mondo popolato da milioni di agenti personali.

Un agente cerca per il proprio utente l’ultimo tavolo disponibile in un ristorante. Un altro cerca i posti migliori per un concerto. Altri monitorano continuamente voli e visite mediche, camere d’albergo o automobili a noleggio.

Ognuno ha ricevuto sostanzialmente lo stesso mandato: ottenere la soluzione migliore possibile per la persona che rappresenta.

A quel punto gli agenti iniziano inevitabilmente a incontrarsi sullo stesso terreno digitale.

Oggi un essere umano che prova a prenotare una risorsa scarsa è limitato dal tempo, dalla pazienza e dalla velocità con cui riesce a utilizzare un sito. Un agente può controllare centinaia di volte al giorno, interrogare API vulnerabili - come abbiamo visto - e provare percorsi che la normale interfaccia grafica nemmeno mostra.

Il vantaggio competitivo può quindi spostarsi dalla rapidità del dito alla capacità tecnica dell’agente. Su scala mondiale, questa dinamica potrebbe trasformare molti servizi digitali in ambienti ostili.

Prenotazioni e liste d’attesa possono funzionare infatti soltanto finché tutti rispettano le regole che le governano. Basta che alcuni agenti imparino a ottenere risultati migliori, sfruttando falle o zone grigie, perché gli altri abbiano un incentivo a diventare altrettanto aggressivi.

L’allineamento non può più essere pensato soltanto come il rapporto tra un’IA e la persona che la utilizza. Va considerato come un rapporto tra quattro soggetti: il sistema di IA, l’utente, chi lo sviluppa e la società. È quello che sostiene Iason Gabriel, filosofo e responsabile di un gruppo di ricerca sull’etica dell’IA in Google DeepMind.

“Dal punto di vista del singolo individuo, il fatto che qualcosa sia nel mio interesse non implica che io debba farlo o che ne abbia il diritto morale - ha spiegato Gabriel -. Per esempio, rubare potrebbe essere nel mio interesse, ma non ho il diritto di farlo, se non forse in circostanze molto particolari. Lo stesso vale per le decisioni collettive. Ad esempio, potrebbe essere sbagliato usare una persona innocente come capro espiatorio per scongiurare la violenza, anche qualora ciò fosse nell'interesse collettivo della società. Per estensione, sarebbe sbagliato che un'IA compisse tali azioni. Questi esempi evidenziano i diversi aspetti per cui l'approccio basato sugli interessi risulta insufficiente. Occorre un criterio per gestire i compromessi tra gli interessi e le pretese di persone diverse”.

Dall’allineamento dell’IA all’allineamento della società

Un assistente personale viene venduto proprio per essere dalla parte del proprio cliente. Deve trovare opportunità e risolvere problemi. Il valore commerciale cresce quanto più diventa bravo a farlo.

La società, però, funziona grazie a regole che impediscono a ciascuno di massimizzare il proprio vantaggio con qualsiasi mezzo disponibile.

Trasferire queste regole agli agenti richiederà probabilmente molto più di modelli educati a rifiutare richieste chiaramente criminali.

Serviranno sistemi di autorizzazione robusti, permessi molto più granulari, conferme umane per azioni sensibili e servizi online progettati assumendo che dall’altra parte possa esserci un software instancabile, estremamente competente e interessato esclusivamente al successo del proprio utente.

La vulnerabilità della palestra australiana era piccola. Andrew voleva una lezione al mattino. Il suo agente aveva a disposizione internet, tempo, strumenti e un obiettivo da raggiungere. Ha trovato una scorciatoia.

Tra poco potrebbero esserci milioni di agenti impegnati nello stesso esercizio, contemporaneamente, per quasi ogni cosa che vale la pena ottenere.