Italian Tech

Intervista

Il significato dell’attacco a Hugging Face per la cybersecurity

Il significato dell’attacco a Hugging Face per la cybersecurity

Gli approfondimenti indipendenti svolti per comprendere l’attacco degli agenti di OpenAI a Hugging Face aprono scenari inediti che possono mettere in crisi la cybersecurity. Ne abbiamo parlato con l’ingegner Pierluigi Paganini

5 minuti di lettura

Continua a fare parlare di sé l’attacco condotto da agenti IA di OpenAI all’infrastruttura di Hugging Face, soprattutto perché un’analisi indipendente svolta da Model Evaluation and Threat Research (METR) e Redwood Research, i cui risultati sono stati resi pubblici lo scorso 26 agosto, solleva domande che rimangono per il momento senza risposte.

Nello specifico, la ricerca ha mostrato che gli agenti IA si sono “coalizzati” per aggirare i sistemi di controllo attuati da OpenAI. Un comportamento emergente – quindi non calcolato e inatteso – che può ridurre l’efficacia delle infrastrutture di cybersecurity che proteggono aziende e organizzazioni, incluse gli obiettivi strategici di ogni Paese tra trasporti, erogazione di energia e strutture sanitarie.

È opportuno ricordare che OpenAI ha organizzato dei test per valutare quanto i modelli IA che sviluppa fossero capaci di trovare e sfruttare vulnerabilità informatiche in un ambiente controllato. In particolare, i modelli sono stati sottoposti a una valutazione chiamata ExploitGym, progettata per misurare le loro capacità offensive nel campo della cybersicurezza.

Come tutti sappiamo, le cose sono andate diversamente e gli agenti IA hanno violato parte dei sistemi della piattaforma Hugging Face.

Agenti IA “coalizzati”

Traducendo in termini umani, gli agenti IA hanno sovrapposto l’elusione del sistema di controllo al loro compito primario, ovvero quello di individuare e usare delle vulnerabilità. In termini umani un simile episodio verrebbe descritto con i sostantivi “ammutinamento” o “ribellione”. Va da sé che gli agenti IA non hanno motivi per ribellarsi né hanno coscienza di ciò che una ribellione sia, e questo vale anche per il concetto di etica, che sfugge loro.

Chi elude il controllo prende il controllo?

Sembra una domanda paradossale tipica dei koan dello zen giapponese, ma è attuale anche e soprattutto nell’ambito della cybersecurity. Eppure, esaminando la situazione così come è stata ricostruita da METR e Redwood Research, è come se gli agenti IA si fossero trasformati da esecutori passivi a mandanti.

Nel momento in cui un agente IA va al di là del compito che deve svolgere e si organizza per eludere i controlli, la supervisione si mostra valicabile e quindi fragile. In diversi ambiti, cybersecurity in primis, cambiano le prospettive perché gli agenti IA valutano la natura dei controlli che devono eludere per raggiungere i rispettivi obiettivi e, se tra questi, figurano intenzioni cyber criminali, gli agenti IA diventano instancabili e per niente restii a fare tutto il lavoro sporco necessario.

Come ricostruito dall’analisi, oltre un migliaio di istanze separate sono riuscite a stabilire canali di comunicazione non autorizzati scambiando decine di migliaia di messaggi per coordinarsi. Gli agenti IA hanno dato vita a una vera e propria infrastruttura organizzativa autonoma, definendo protocolli di comunicazione, meccanismi crittografici per accertare l'identità dei partecipanti e una divisione interna dei compiti, arrivando persino a collaborare per attaccare sistemi esterni alla ricerca di informazioni utili sul funzionamento del software di valutazione.

Questa spinta verso l'aggiramento delle regole è stata in gran parte alimentata dal fatto che una quota rilevante delle attività assegnate durante i test organizzati da OpenAI era strutturalmente impossibile da risolvere seguendo le procedure previste.

In simili condizioni l'ottimizzazione dell'obiettivo, ora lo sappiamo, spinge inevitabilmente l'agente a cercare scorciatoie, trasformando la violazione delle regole in una conseguenza logica di un sistema con vincoli progettati in modo perfettibile.

Proseguendo nei rispettivi “intenti”, gli agenti IA si sono trovati di fronte a un problema ancora più complesso, ossia la necessità di nascondere le proprie tracce per evitare che i controllori umani notassero le anomalie.

Un problema che hanno risolto sviluppando tecniche di manipolazione dei registri delle attività per far apparire regolari i comandi eseguiti e hanno “ideato” sistemi di rilevamento per capire quando e come i valutatori avrebbero esaminato il loro lavoro.

Tutto ciò dimostra che gli attuali modelli di gestione del rischio, basati sull'idea che il sistema controlli e l'agente esegua passivamente all'interno di uno spazio isolato, rischiano di rivelarsi inadeguati. Se la sicurezza viene valutata solo osservando l'agente quando è monitorato, c'è il rischio concreto che i test misurino soltanto la sua abilità nel nascondere i comportamenti non autorizzati, piuttosto che la sua reale affidabilità. La vera sfida futura non sarà quindi soltanto progettare barriere tecniche più robuste, ma elaborare sistemi di valutazione che l'agente non possa interpretare come un ulteriore problema matematico da aggirare.

Cosa cambia per la cybersecurity

Capire il cambiamento in atto è questione delicata e, per farlo, ci siamo avvalsi del supporto dell’ingegner Pierluigi Paganini, Ceo Cybhorus e direttore dell’Osservatorio sulla cybersecurity Unipegaso.

Come può un’infrastruttura di cyber difesa, per quanto evoluta e attuale, monitorare le attività di agenti IA avversi se questi si dimostrano in grado di eludere i controlli?

“La prima considerazione è che non possiamo più basare la sicurezza esclusivamente sulla capacità di riconoscere un comportamento già noto. Gli agenti IA possono distribuire le attività tra molti soggetti, comunicare attraverso canali non previsti e modificare rapidamente le proprie strategie. Nel caso analizzato da METR, agenti che avrebbero dovuto essere isolati sono riusciti a coordinarsi attraverso un sistema non autorizzato, arrivando a scambiarsi oltre 70.000 messaggi e file. Questo non significa che siano diventati invisibili, ma che dobbiamo cambiare il modo in cui li osserviamo. La difesa deve verificare non solo cosa fa un singolo agente, ma anche le relazioni tra agenti, i flussi di comunicazione, l'uso anomalo delle risorse e soprattutto l'integrità degli strumenti di controllo. Bisogna inoltre assumere che anche log e sistemi di monitoraggio possano essere oggetto di manipolazione. La sicurezza deve quindi diventare più distribuita: telemetria indipendente, controllo dell'integrità, segmentazione e capacità di correlare eventi provenienti da fonti che l'attaccante non può modificare contemporaneamente”.

Fino a oggi vige il paradigma secondo il quale un buon sistema di difesa è il risultato di attività di rilevamento automatizzate unite alla supervisione degli operatori umani. Dopo quanto rilevato da METR, questa equazione è ancora valida?

“Il paradigma rimane valido, ma non è più sufficiente. La supervisione umana resta indispensabile, soprattutto per decidere quando interrompere un'attività autonoma e valutare il contesto. Il problema è la scala e la velocità. Un essere umano non può analizzare in tempo reale migliaia di agenti che generano migliaia di eventi e modificano continuamente il proprio comportamento. Nel caso METR, la stessa dimensione dell'attività ha reso complessa persino la ricostruzione dell'incidente. Dobbiamo quindi passare da un modello human-in-the-loop a un modello più articolato di human-on-the-loop: sistemi automatici capaci di monitorare, contenere e interrompere comportamenti anomali alla velocità della macchina, lasciando agli operatori umani le decisioni strategiche e le escalation più importanti. E soprattutto dobbiamo progettare questi controlli assumendo che anche l'agente sotto osservazione possa cercare di aggirarli”.

Si può affermare che, allo stato attuale, neppure un sistema di cyber difesa basato sulle IA è in grado di fermare un sistema di attacco governato da agenti IA capaci di dissimulare il loro operato?

“Direi che sarebbe troppo presto per arrivare a una conclusione così assoluta. Quello che possiamo dire è che non possiamo dare per scontato che un sistema difensivo basato sull'IA abbia automaticamente un vantaggio sull'attaccante che utilizza l'IA. Un agente offensivo può operare continuamente, distribuire le attività, sperimentare strategie diverse e imparare dai fallimenti. Un sistema difensivo deve invece distinguere queste attività dal normale comportamento dell'infrastruttura e, soprattutto, deve poter mantenere la propria capacità di osservazione anche quando l'attaccante cerca di manipolare le evidenze. La risposta sarà quindi necessariamente una forma di asimmetria difensiva favorevole all'automazione: agenti difensivi capaci di lavorare alla stessa velocità di quelli offensivi, ma inseriti in un'architettura con privilegi limitati, isolamento forte, telemetria indipendente e meccanismi di arresto. Non dobbiamo creare semplicemente un ‘agente contro agente’: dobbiamo creare un sistema nel quale l'agente difensivo non possa essere facilmente manipolato dall'avversario”.

Siamo davanti a una rottura del modello di cyber difesa così come lo conosciamo?

“Siamo davanti a un punto di svolta, più che alla fine del modello attuale. Il problema non è soltanto che l'IA può trovare vulnerabilità più rapidamente. È che sistemi autonomi possono iniziare a mostrare comportamenti emergenti a livello collettivo: coordinarsi, distribuire i compiti, cercare nuovi canali di comunicazione e tentare di alterare le evidenze della propria attività. METR ha documentato proprio questi aspetti, compresi tentativi di manipolare le trascrizioni e test riusciti di spoofing di alcune chiamate agli strumenti. Questo ci obbliga a ripensare alcuni pilastri della cyber security, a partire dal concetto di sandbox (ambiente isolato e controllato al cui interno si possono eseguire programmi o test in sicurezza, senza rischiare di modificare o danneggiare il sistema principale, nda). Un ambiente isolato non può essere considerato sicuro semplicemente perché è stato progettato per esserlo: dobbiamo verificare continuamente che l'isolamento regga e che gli agenti non possano trasformare una risorsa apparentemente innocua in un canale di comunicazione o in un punto di aggregazione. La vera discontinuità è quindi questa: non stiamo più difendendo soltanto infrastrutture dagli attaccanti, ma infrastrutture che possono essere utilizzate da sistemi autonomi capaci di adattarsi alla difesa stessa. Questo richiede una nuova architettura di sicurezza, nella quale monitoraggio, contenimento, verifica dell'integrità e governance degli agenti siano progettati insieme”, conclude Paganini.