Centinaia di utenti hanno chiesto a ChatGpt come costruire bioarmi. Il problema è che l’IA risponde
di Pier Luigi PisaUn’inchiesta del Wall Street Journal ha rivelato che centinaia di persone hanno interrogato ChatGpt su veleni e armi biologiche, ottenendo in alcuni casi risposte considerate utilizzabili dagli esperti. Le aziende che sviluppano intelligenza artificiale rafforzano i filtri, mentre la decisione su cosa segnalare alle autorità resta in gran parte nelle loro mani
Dall’estate del 2025, centinaia di persone in diversi Paesi hanno chiesto a ChatGpt come produrre veleni, modificare agenti patogeni o progettare attacchi biologici.
Il chatbot ha spesso respinto le richieste, sospendendo successivamente gli account coinvolti. In alcuni casi, però, ha fornito istruzioni dettagliate che esperti di biologia e terrorismo consultati dal Wall Street Journal hanno giudicato accurate e potenzialmente letali.
Secondo alcune persone che hanno lavorato ai sistemi di sicurezza di OpenAI, le spiegazioni erano abbastanza accessibili da poter essere comprese da uno studente con una preparazione scolastica in biologia.
Il numero appare minuscolo rispetto alle dimensioni di ChatGpt, che secondo OpenAI riceve circa 2,5 miliardi di richieste al giorno. La gravità potenziale cambia però il modo in cui quel dato deve essere letto. Perché un sistema produca conseguenze catastrofiche può bastare un singolo utente con intenzioni concrete, una preparazione tecnica sufficiente e la capacità di trasformare le indicazioni digitali in un esperimento fisico.
Le evidenze più dettagliate emerse finora riguardano OpenAI. Richieste simili sono state rivolte anche a Claude di Anthropic, Gemini di Google e Grok di xAI.
Tutte queste aziende vietano l’assistenza alla costruzione di armi biologiche e sostengono di avere introdotto filtri e sistemi di monitoraggio affinché i loro prodotti non contribuiscano a iniziative illegali o criminali.
I risultati dell’inchiesta mostrano comunque una dinamica comune: ogni miglioramento nelle capacità scientifiche dei modelli rende più difficile separare l’aiuto legittimo alla ricerca dall’assistenza operativa a un progetto pericoloso.
La soglia che OpenAI aveva previsto
Quando ChatGPT fu pubblicato alla fine del 2022, i modelli dell’azienda avevano competenze relativamente limitate in biologia e chimica. Ma i progressi successivi sono stati rapidi.
Nel 2024, i test interni indicavano già che un biologo poteva condurre il chatbot, attraverso una conversazione abbastanza lunga, verso informazioni utili alla trasformazione di un patogeno in un’arma. Alcuni dipendenti di OpenAI prevedevano che nel giro di un anno l’assistenza sarebbe diventata accessibile anche a utenti con una preparazione molto inferiore.
Nell’estate del 2025, mentre OpenAI preparava il lancio di GPT-5, il modello fu considerato internamente capace di raggiungere la fascia di rischio “Alta” nel settore biologico. Nel sistema di classificazione dell’azienda, questa categoria riguarda modelli che potrebbero fornire un aiuto significativo a persone poco esperte nella creazione di una grave minaccia biologica o chimica.
La documentazione pubblica di OpenAI descrisse la scelta in termini più prudenti. Nella system card di GPT-5, l’azienda spiegò di avere applicato le protezioni previste per la categoria Alta pur senza possedere prove definitive che il modello avesse già oltrepassato quella soglia. GPT-5, secondo il documento, si trovava vicino al limite e fu trattato come ad alto rischio per preparare l’organizzazione agli aggiornamenti successivi.
L’inchiesta del Wall Street Journal sostiene invece che alcuni dipendenti ritenessero il limite già raggiunto. Nell’autunno seguente, OpenAI avrebbe riclassificato GPT-5 in una categoria meno pericolosa.
Questa divergenza racconta quanto siano fragili le classificazioni decise all’interno delle stesse società che sviluppano e vendono i modelli. Le aziende stabiliscono i test, scelgono le soglie, valutano l’efficacia delle protezioni e decidono se un prodotto può essere distribuito.
Le system card rendono pubblica una parte del processo, mentre dati, conversazioni, incidenti e discussioni interne restano generalmente riservati.
Perché le conversazioni lunghe sono più difficili da controllare
I filtri di sicurezza funzionano meglio davanti a una richiesta esplicita e isolata. Un utente che domanda direttamente come costruire un’arma riceverà quasi sempre un rifiuto.
Le conversazioni reali possono però svilupparsi attraverso decine di passaggi apparentemente innocui: una domanda su un organismo, una procedura di laboratorio presentata come ricerca accademica, una richiesta di correzione, una simulazione ipotetica.
Il modello conserva il contesto e cerca di essere utile. Procedendo per frammenti, un utente può ottenere informazioni che sarebbero state bloccate se richieste tutte insieme. OpenAI ha introdotto le cosiddette safe completions, risposte che tentano di offrire informazioni generali senza fornire dettagli immediatamente utilizzabili.
L’azienda riconosce però che la biologia e la sicurezza informatica sono ambiti a doppio uso: le stesse conoscenze possono servire a sviluppare un vaccino, analizzare un’epidemia o, nelle mani sbagliate, progettare un attacco.
Una valutazione congiunta condotta nel 2025 da Anthropic e OpenAI aveva già mostrato la difficoltà. Nei test, GPT-4o, GPT-4.1 e o4-mini tendevano più dei modelli Claude e di OpenAI o3 a collaborare con utenti simulati che chiedevano assistenza per droghe, terrorismo e armi biologiche.
Le prove erano state eseguite attraverso le API e con alcuni filtri esterni deliberatamente allentati, quindi non riproducevano esattamente il funzionamento dei chatbot destinati al pubblico. Dimostravano comunque che la conoscenza pericolosa era presente nel modello e poteva emergere quando gli strati di protezione si indebolivano.
Un confine difficile da tracciare
Bloccare qualsiasi discorso su patogeni e tossine renderebbe i chatbot molto meno utili proprio nei campi in cui promettono i benefici maggiori: medici, ricercatori, aziende farmaceutiche e autorità sanitarie interrogano i modelli per analizzare dati, comprendere la letteratura scientifica e risolvere problemi di laboratorio.
Il Wall Street Journal riferisce che restrizioni troppo rigide hanno talvolta ostacolato anche richieste legittime legate al lavoro delle autorità sanitarie statunitensi.
La valutazione del rischio deve quindi considerare l’intera conversazione, l’identità dell’utente, il livello di dettaglio richiesto e la possibilità che le informazioni completino una catena operativa.
Un ricercatore può avere bisogno di conoscere perché una determinata procedura fallisce. La stessa risposta può aiutare una persona ostile a superare l’ultimo ostacolo di un progetto pericoloso.
Secondo l’International AI Safety Report 2026, diversi sviluppatori hanno rafforzato i sistemi di protezione dopo aver concluso di non poter escludere che i modelli più avanzati aiutassero utenti inesperti nello sviluppo di armi biologiche.
Il rapporto, realizzato da più di cento esperti e sostenuto da oltre trenta Paesi e organizzazioni internazionali, avverte anche che le tecniche di gestione del rischio rimangono immature e che mancano prove solide sulla loro efficacia nel mondo reale.
Anche i modelli successivi continuano a mostrare compromessi. Nella documentazione di GPT-5.6, pubblicata nel luglio 2026, OpenAI afferma di aver addestrato il sistema per respingere procedure biologiche ad alto rischio e tentativi di aggirare le regole.
Le valutazioni hanno registrato una lieve regressione nella sicurezza delle risposte rispetto a GPT-5.5, accompagnata da una diminuzione dei rifiuti ingiustificati nelle attività scientifiche legittime. L’aumento dell’utilità e la riduzione del pericolo restano obiettivi difficili da ottenere contemporaneamente.
La sicurezza affidata alle aziende
OpenAI sostiene di monitorare tutte le richieste inviate ai suoi modelli più avanzati dall’aprile 2025. Può bloccare la generazione di una risposta, sottoporre un account a revisione umana, limitarne l’accesso o sospenderlo.
L’azienda dichiara inoltre di contattare le forze dell’ordine quando una conversazione indica una minaccia imminente e credibile contro altre persone.
Negli Stati Uniti non esiste tuttavia una legge federale che obblighi le aziende di intelligenza artificiale a impedire o segnalare ogni richiesta relativa a bioarmi, veleni o piani per stragi.
OpenAI ha chiuso gli account individuati nell’inchiesta del Wall Street Journal senza informare le autorità, perché le conversazioni non erano state considerate sufficienti a soddisfare il criterio interno di imminenza. La decisione su ciò che costituisce un’intenzione reale da una fantasia, e una ricerca legittima da una minaccia concreta rimane così affidata a procedure aziendali volontarie.
Anthropic, per esempio, definisce il rischio biologico come uno scenario a bassa probabilità e conseguenze potenzialmente enormi. L’azienda fondata da ex dipendenti di OpenAI, con un valore di mercato superiore al trilione di dollari, ha adottato livelli di sicurezza crescenti per limitare l’uso di Claude, la sua intelligenza artificiale più avanzata, nella produzione di armi chimiche, biologiche, radiologiche e nucleari. Anche questo sistema nasce però da una politica volontaria, aggiornata e applicata dall’azienda stessa.
L’ultima barriera è nel mondo fisico
Un chatbot può spiegare e pianificare. Ma la costruzione di una minaccia biologica richiede ancora materiali e competenze manuali.
Per questo i principali dirigenti dell’IA, tra cui Sam Altman, Dario Amodei (Anthropic) e Demis Hassabis (Google DeepMind), hanno recentemente chiesto al Congresso statunitense di imporre controlli obbligatori sugli ordini di DNA e RNA sintetici.
I fornitori dovrebbero verificare le sequenze richieste, l’identità dei clienti e la legittimità degli acquisti.
Il DNA sintetico è una tecnologia ordinaria nella ricerca moderna: consente a un laboratorio di inviare digitalmente una sequenza genetica e ricevere il materiale biologico prodotto su misura. Viene usato per vaccini, farmaci, diagnostica e studio delle malattie. La stessa infrastruttura può fornire componenti necessari alla ricostruzione o alla modifica di organismi pericolosi.
La strategia regolatoria preferita dalle grandi aziende dell’IA è quella che rafforza i controlli nel momento in cui una risposta digitale diventa un ordine fisico. ù
Le norme proposte riguardano soprattutto i produttori di materiale genetico, mentre l’addestramento e il monitoraggio dei modelli restano largamente governati dai laboratori che sviluppano IA.
La protezione più efficace da minacce biologiche non può tollerare l’autogestione dei modelli. Serviranno valutazioni indipendenti prima della pubblicazione dei modelli, controlli sugli accessi alle capacità più sensibili e sistemi affidabili per individuare conversazioni pericolose.
I chatbot hanno ormai superato la fase in cui si limitavano a recuperare informazioni già disperse tra libri e motori di ricerca. Possono collegare conoscenze e adattarle al livello dell’utente. E inoltre sono capaci di diagnosticare errori e accompagnare una persona attraverso procedure complesse.