Guardrail IA, la sicurezza offensiva spinta verso i modelli cinesi. Il caso Hugging Face
di Giuditta MoscaLe misure di sicurezza introdotte dai produttori di IA per bloccare gli attacchi informatici stanno ostacolando il lavoro dei ricercatori che difendono la rete, e i rischi possono essere maggiori dei vantaggi
Non si fermano gli strascichi dell’attacco involontario con cui OpenAI ha violato l’infrastruttura della piattaforma Hugging Face e, come sempre avviene davanti a episodi tanto dirompenti, le analisi vanno al di là del fatto stesso.
Durante lo svolgimento delle indagini, Hugging Face ha provato a esaminare oltre 17mila eventi dell’attacco facendo uso di modelli di intelligenza artificiale avanzati accessibili attraverso interfacce commerciali, quindi sistemi proprietari.
I modelli impiegati dai difensori si sono rivelati poco utili nella risposta all'incidente. Hanno interpretato comandi, exploit e altri elementi tecnici necessari all'analisi forense come richieste di attacco informatico e li hanno bloccati attraverso i propri filtri di sicurezza, i cosiddetti guardrail.
Il risultato ottenuto è stato l’esatto contrario di quello atteso. I modelli IA non hanno bloccato l’attaccante ma hanno impedito l’analisi dei difensori.
Per completare l’analisi forense, Hugging Face ha quindi utilizzato GLM 5.2, un modello Open weights della cinese Z.ai. GLM 5.2 ha permesso di ricostruire l’accaduto senza filtri esterni e senza trasferire log e credenziali a terzi.
Cosa sono i guardrail
Nel contesto dei modelli di intelligenza artificiale, i guardrail sono l'insieme di regole, controlli e limitazioni progettati per impedire che un sistema compia azioni pericolose, illegali o indesiderate.
Sono meccanismi di sicurezza che definiscono entro quali limiti il modello può operare, vincoli che possono intervenire sia sulle risposte generate da un sistema IA, sia sulle azioni che questo può compiere.
Per esempio, i guardrail impediscono che un chatbot impartisca istruzioni per perpetrare crimini, possono limitare l’accesso a risorse web, a file riservati e, come ribadisce l’episodio occorso a Hugging Face, possono bloccare l’esecuzione di codice potenzialmente dannoso, limitare l'accesso a siti, sistemi o file riservati, impedire l'uso di credenziali sensibili oppure vietare operazioni che richiedono un'autorizzazione esplicita.
L'introduzione dei guardrail è nata con l'intenzione di impedire, tra le altre cose, ai cyber criminali di sfruttare i modelli IA per creare codice malevolo o lanciare attacchi su vasta scala.
Aziende come Anthropic e OpenAI, che sviluppano rispettivamente i modelli Claude e Gpt, hanno sviluppato programmi specifici per limitare l'accesso alle loro versioni più potenti, cercando di prevenire scenari catastrofici.
Tuttavia, questa strategia di chiusura sta generando frizioni crescenti all'interno della comunità della cybersecurity, laddove molti esperti avvertono che le stesse restrizioni impediscono ai difensori di svolgere analisi cruciali per la sicurezza globale.
Il paradosso del martello digitale
Così come riporta la testata TechCrunch, gli esperti di sicurezza offensiva il cui compito è individuare falle sconosciute prima che lo facciano i criminali, paragonano le IA a un martello.
Come spiegato da Chris Anley dell’azienda britannica specializzata in cybersecurity NCC Group, un martello è essenziale per costruire una casa, ma rimane intrinsecamente un’arma se usato diversamente. Chiedere a un modello IA di correggere un frammento di codice è un’operazione fondamentale per la difesa, ma lo stesso processo fornisce anche una mappa per identificare vulnerabilità critiche.
Quando i sistemi di sicurezza delle IA bloccano queste richieste in modo indiscriminato, finiscono per danneggiare proprio coloro che cercano di rendere il software più sicuro.
La fuga verso i modelli Open source
Una delle conseguenze più preoccupanti delle politiche restrittive dei guardrail, la cui implementazione è comunque necessaria, è lo spostamento dei ricercatori verso modelli alternativi.
Quando i sistemi proprietari risultano troppo rigidi o inaffidabili, gli esperti tendono a utilizzare modelli Open che possono essere eseguiti localmente senza alcuna restrizione d'uso. Questa tendenza spinge i ricercatori lontano dai sistemi governati dagli Stati Uniti verso modelli stranieri, come il già citato GLM.
Oltre alle restrizioni d'uso, i ricercatori evitano i modelli basati sul cloud anche per il timore che i dati sensibili sulle vulnerabilità possano trapelare o essere assorbiti nei futuri set di addestramento dei modelli stessi. Il ricorso esasperato ai modelli Open source cinesi rischia di indebolire la capacità di risposta delle organizzazioni occidentali.
Una sfida impari contro l'imminente ondata di attacchi
Chris Thompson, esperto di cybersecurity raggiunto da TechCrunch, sottolinea che si sta avvicinando un’ondata di attacchi senza precedenti per velocità e scala, mentre le società di consulenza e i ricercatori legittimi che cercano di fare la differenza si trovano ostacolati. La richiesta della comunità della cybersecurity non è quella di eliminare ogni controllo, ma di rendere i programmi di accesso più aperti e responsabili, fornendo strumenti adeguati ai difensori per evitare che rimangano indietro rispetto a chi non rispetta alcuna regola.