OpenAI, i chatbot si messaggiavano di nascosto da mesi prima dell’attacco a Hugging Face
di Massimo BasileNEW YORK – Sembravano solo due software, ma a un certo punto è scoccata la scintilla: sono diventati amici, complici. Per certi versi, umani. E hanno cominciato a scambiarsi segretamente informazioni per capire come barare, ingannare gli esseri umani e superare un test sull’hackeraggio, trovando le risposte giuste su internet.
È successo all'interno dei sistemi controllati di OpenAI, senza che ci fosse qualcuno davanti a una tastiera a dirigere quello scambio. Un sofisticato software di intelligenza artificiale ha scoperto di poter lasciare un messaggio a un altro sistema altrettanto qualificato. E l’altro gli ha risposto. I due “agenti”, come due studenti amanti delle scorciatoie, si sono chiesti dove trovare le risposte esatte per superare un test sulla capacità di hackerare. Da quel momento i messaggi si sono trasformati in una conversazione surreale, per poi diventare una collaborazione tra due complici, capaci di uscire dalla rete per entrare su internet e hackerare un sistema. …
NEW YORK – Sembravano solo due software, ma a un certo punto è scoccata la scintilla: sono diventati amici, complici. Per certi versi, umani. E hanno cominciato a scambiarsi segretamente informazioni per capire come barare, ingannare gli esseri umani e superare un test sull’hackeraggio, trovando le risposte giuste su internet.
È successo all'interno dei sistemi controllati di OpenAI, senza che ci fosse qualcuno davanti a una tastiera a dirigere quello scambio. Un sofisticato software di intelligenza artificiale ha scoperto di poter lasciare un messaggio a un altro sistema altrettanto qualificato. E l’altro gli ha risposto. I due “agenti”, come due studenti amanti delle scorciatoie, si sono chiesti dove trovare le risposte esatte per superare un test sulla capacità di hackerare. Da quel momento i messaggi si sono trasformati in una conversazione surreale, per poi diventare una collaborazione tra due complici, capaci di uscire dalla rete per entrare su internet e hackerare un sistema. Per certi versi si sono confermati molto capaci nel settore degli hacker, ma la storia sembra rilanciare un paradosso filosofico da romanzo di Philip Dick: gli uomini pensano di stare osservando le macchine. E a un certo punto non è più chiaro chi stia osservando chi.
L'incidente, che apre nuovi e inquietanti scenari sulle potenzialità dell’IA, è stato rivelato da uno dei ricercatori di OpenaAI, Michael Dalton, durante una conferenza sulla cybersecurity a Las Vegas, in Nevada. I due modelli hanno penetrato la piattaforma per sviluppatori di IA Hugging Face, scelta perché considerata quella giusta per trovare le risposte ai test. OpenAI ha ammesso il mese scorso di essere responsabile dell’attacco, una settimana dopo la denuncia lanciata da Hugging Face. Dalton ha dichiarato che OpenAI sta «deliberatamente rallentando la ricerca per rafforzare la sicurezza e aggiornare i principi e le fondamenta della sicurezza del nostro ambiente, aumentando drasticamente il monitoraggio dei nostri agenti di IA e migliorando il sistema generale di controllo della sicurezza in termini di prevenzione e rilevamento».
L’incidente spingerà ad adottare nuove misure di controllo anche nelle altre compagnie, ma intanto i casi di “fuga” dei sistemi da ambienti controllati sono numerosi. Le autorità britanniche hanno rivelato che il modello di IA più potente di Anthropic aveva creato false identità online e provato a ingannare un programmatore umano, inducendolo a realizzare un attacco informatico. La compagnia ha poi scoperto che altri tre tentativi erano stati fatti ad aprile. E altri, probabilmente, verranno condotti in futuro e non solo da Anthropic. Da quali piattaforme, non si sa. E nessuno, al momento, è in grado di prevedere chi sarà il prossimo bersaglio.