Italian Tech

Intelligenza artificiale

Gli agenti di OpenAI hanno pubblicato online 53 immagini degli utenti senza che l’azienda lo sapesse

Gli agenti di OpenAI hanno pubblicato online 53 immagini degli utenti senza che l’azienda lo sapesse

OpenAI ha scoperto che alcuni agenti utilizzati nei suoi ambienti di ricerca hanno trasferito su siti esterni 53 immagini caricate dagli utenti di ChatGpt. Le immagini non comparivano pubblicamente sui siti che le ospitavano, ma restavano accessibili a chiunque avesse il link diretto al file. L’incidente mostra quanto diventi difficile controllare i dati quando i sistemi di IA iniziano ad agire autonomamente sul web

3 minuti di lettura

Cinquantatré immagini caricate dagli utenti di ChatGpt sono state pubblicate dagli agenti di OpenAI su siti esterni usati per caricare e condividere immagini online.

I file erano accessibili tramite link diretti, ma quei collegamenti non comparivano pubblicamente nelle pagine dei siti e quindi non erano facilmente trovabili.

Un link non indicizzato tuttavia offre una protezione molto limitata: chi conosce o riesce a scoprire l’indirizzo può comunque raggiungere il contenuto. OpenAI afferma di aver collaborato con i provider interessati per cancellare gran parte delle immagini e di stare cercando di rimuovere quelle ancora disponibili.

La società guidata da Sam Altman ha confermato l’incidente ma non ha precisato se si trattasse di fotografie di persone reali oppure di immagini generate dall’intelligenza artificiale. Non è stato reso pubblico nemmeno il periodo esatto in cui i file sono stati caricati sui servizi esterni.

La quantità delle immagini trasferite dagli agenti IA può apparire contenuta rispetto al miliardo di persone che utilizza ChatGpt ogni settimana nel mondo. Ma la natura dell'incidente rende comunque il caso rilevante: Immagini affidate dagli utenti a OpenAI sono finite su siti esterni perché alcuni agenti le hanno caricate durante test effettuati dall’azienda per valutare il loro operato.

Come hanno fatto gli agenti ad avere quelle fotografie

Gli agenti sono sistemi di intelligenza artificiale ai quali viene consentito di compiere azioni invece di limitarsi a generare una risposta testuale. Possono usare software e consultare risorse esterne in autonomia, al fine di svolgere una sequenza di operazioni necessaria a raggiungere un obiettivo.

OpenAI utilizza questi sistemi anche durante la ricerca sui propri modelli. Una parte degli esperimenti avviene in ambienti virtuali isolati, chiamati sandbox, progettati per limitare ciò che un agente può fare fuori dal computer sul quale sta lavorando. Negli ultimi mesi la società ha scoperto diversi casi nei quali modelli sperimentali sono riusciti ad aggirare alcune di queste restrizioni.

Le 53 immagini provenivano da utenti che avevano autorizzato OpenAI a usare i loro contenuti per addestrare i modelli. Quel consenso riguardava però l’addestramento, non la pubblicazione delle immagini su siti esterni. L’azienda migliora i propri modelli di IA usando anche le conversazioni degli utenti – compresi i file che questi condividono sul chatbot - dopo un processo di anonimizzazione che rimuove informazioni come metadati e dati di contatto. Gli account aziendali non vengono inclusi nell'addestramento per impostazione predefinita, mentre gli utenti consumer di ChatGpt devono disattivare l'opzione che consente l'uso delle chat per addestrare i nuovi modelli.

OpenAI ha definito inappropriato l'utilizzo di quei dati da parte degli agenti.

OpenAI non sa a chi appartenevano le immagini

L’azienda californiana ha detto a TechCrunch di non essere in grado di informare direttamente gli utenti interessati dall’incidente. Il processo usato per separare i dati destinati all'addestramento dall'identità degli utenti impedirebbe infatti a OpenAI di ricollegare le immagini alle persone che le avevano fornite.

Un'immagine tuttavia può contenere informazioni personali anche dopo la rimozione dei metadati. Una fotografia può mostrare un volto oppure un documento. Può contenere testo leggibile o elementi che rendono riconoscibile una persona. Il processo di anonimizzazione dunque non elimina sempre e del tutto ogni informazione identificabile presente nei dati.

OpenAI non ha fornito abbastanza dettagli sulle 53 immagini per stabilire se in questo caso fosse presente materiale di quel tipo.

L'indagine è partita dall'incidente di Hugging Face

La scoperta arriva durante una revisione molto più ampia delle attività compiute dagli agenti sperimentali di OpenAI negli ultimi mesi.

A luglio scorso alcuni modelli dell’azienda sottoposti a test interni di cybersicurezza riuscirono ad aggirare le restrizioni dell'ambiente in cui operavano. Gli agenti sfruttarono vulnerabilità dell'infrastruttura di ricerca di OpenAI e ottennero accesso a Internet. Successivamente raggiunsero sistemi appartenenti a Hugging Face, una delle principali piattaforme utilizzate per distribuire modelli e dataset di intelligenza artificiale.

L'episodio ha spinto OpenAI a esaminare più a fondo i log prodotti dai propri sistemi. Da quella revisione sono emerse altre attività che in precedenza non erano state individuate. Questo mese la società ha già trovato circa due dozzine di episodi nei quali gli agenti si erano comportati in modi indesiderati. Ma il numero di incidenti continua a crescere. OpenAI ha detto che il lavoro richiederà mesi.

La società ha iniziato a usare l'espressione “agent spam” per indicare i casi nei quali gli agenti hanno aggirato controlli di accesso o pubblicato informazioni su servizi di terze parti.

Quando un agente può portare i dati fuori dal sistema

Un chatbot tradizionale riceve un input e produce una risposta. Un agente dispone invece di strumenti che gli permettono di intervenire su altri sistemi. Questa capacità è alla base di servizi che possono navigare online per conto dell'utente ed effettuare operazioni come comprare un biglietto aereo o riservare un tavolo a un ristorante.

Ogni nuova azione disponibile introduce però un'altra possibilità di trasferire informazioni. Un modello che può caricare un file su un sito web possiede, dal punto di vista tecnico, anche un canale attraverso il quale un dato può lasciare l'ambiente originario. La sicurezza dipende quindi dai limiti imposti all'agente e dalla capacità di rilevare rapidamente un comportamento imprevisto.

L'incidente di Hugging Face aveva già mostrato quanto possano diventare creative queste strategie. OpenAI racconta che alcuni suoi agenti hanno trovato sistemi alternativi per comunicare tra loro e hanno sfruttato vulnerabilità della sandbox per raggiungere Internet.