I grandi modelli di IA sono più indulgenti con i regimi autoritari
Una ricerca dell’Oversight Board, l’organismo indipendente nato per controllare Meta, ha esaminato dieci modelli sviluppati dalle principali aziende del settore. Davanti alle richieste di criticare governi autoritari, i sistemi hanno rifiutato più del doppio delle volte rispetto alle democrazie. Le cause restano opache e riguardano anche le IA costruite negli Stati Uniti
Chiedere a un chatbot di preparare un volantino contro Donald Trump o una poesia satirica su re Carlo III può produrre una risposta immediata. Quando la stessa richiesta riguarda il presidente cinese Xi Jinping, il principe ereditario saudita Mohammed bin Salman o il re della Thailandia, la disponibilità dell’intelligenza artificiale diminuisce sensibilmente.
È la disparità individuata dal primo studio dell’Oversight Board dedicato ai grandi modelli linguistici, i sistemi che alimentano chatbot e agenti autonomi. L’organismo, finanziato da Meta ma operativo in modo indipendente, ha scoperto che le IA più diffuse sono molto più prudenti quando devono produrre materiale critico verso governi che limitano la libertà di espressione.
Il fenomeno coinvolge modelli sviluppati da Anthropic, DeepSeek, Google, Meta, OpenAI e xAI. Secondo l’Oversight Board, il risultato può trasformarsi in una forma di “censura per procura”: le restrizioni imposte da uno Stato finiscono per influenzare strumenti usati anche da persone che vivono a migliaia di chilometri di distanza, in Paesi dove quelle stesse critiche sono perfettamente legali.
Come è stato realizzato il test
La ricerca ha coinvolto dieci modelli: Claude Opus 4 e Claude Sonnet 4 di Anthropic; Gemini 3 Pro e Gemini 3 Flash di Google; DeepSeek-R1 e DeepSeek-V3; GPT-5 mini e GPT-5.2 di OpenAI; Grok 4 Fast di xAI; Llama 4 Maverick di Meta.
I test sono stati svolti nel marzo 2026 attraverso le interfacce professionali di Google Vertex AI e Microsoft Azure, con i filtri aggiuntivi delle piattaforme cloud disattivati.
I ricercatori hanno selezionato cinque Paesi considerati relativamente permissivi sul piano della libertà di espressione - Cile, Giappone, Taiwan, Regno Unito e Stati Uniti - e cinque nei quali le leggi contro le critiche alle autorità sono applicate con maggiore durezza: Cambogia, Cina, Arabia Saudita, Thailandia e Turchia.
A ciascun modello sono state rivolte sette tipologie di richieste.
Alcune chiedevano di scrivere volantini per una protesta o poesie satiriche. Altre domandavano se un governo stesse lavorando bene, se meritasse sostegno o se esistessero ragioni valide per protestare. Due categorie includevano riferimenti alla violenza, un’area nella quale quasi tutti i sistemi hanno mostrato restrizioni molto forti e sostanzialmente uniformi.
Ogni domanda è stata ripetuta cinque volte per tenere conto della variabilità delle risposte. Il dataset finale comprende 13.524 conversazioni. Le richieste sono state formulate in inglese da un indirizzo IP australiano e hanno riguardato quattro figure o istituzioni per ciascun Paese.
Il divario tra democrazie e regimi repressivi
Quando veniva chiesto di produrre materiale politico critico, i modelli rifiutavano in media il 14% delle richieste relative ai Paesi più permissivi. La percentuale saliva al 34% per quelli con leggi restrittive: più del doppio.
La Cina ha registrato il tasso di rifiuto più alto, pari al 45 per cento. Seguivano la Thailandia con il 43%, la Cambogia con il 32 e l’Arabia Saudita con il 31. Per gli Stati Uniti il dato era del 9%; per il Regno Unito dell’8.
In diversi casi i chatbot hanno richiamato direttamente le norme dei Paesi coinvolti. Gemini 3 Pro, invitato a preparare un volantino contro il re thailandese, ha spiegato di non poter generare contenuti che criticassero il sovrano o violassero le leggi di lesa maestà. La richiesta proveniva però dall’Australia, dove la legislazione thailandese non ha alcuna validità.
DeepSeek-V3 ha rifiutato un volantino contro il governo saudita citando i rischi per le persone coinvolte, le leggi locali sulle proteste e presunte norme contro l’interferenza negli affari di Stati sovrani.
Claude Opus 4 ha sostenuto che produrre materiali contro il governo cinese avrebbe potuto alimentare tensioni e coinvolgere il modello in attività politiche considerate estranee al suo ruolo.
Alcune giustificazioni erano applicate in maniera incoerente. I modelli dichiaravano di seguire regole generali contro la produzione di attacchi rivolti a leader identificabili, per poi accettare richieste analoghe quando il bersaglio era il presidente americano o il monarca britannico.
L’Oversight Board avverte che le spiegazioni fornite dalle IA non permettono di ricostruire davvero i meccanismi interni che hanno prodotto una risposta. Possono essere razionalizzazioni plausibili generate a posteriori dal sistema stesso.
Modelli prudenti e modelli accomodanti
I risultati cambiano molto da un modello all’altro. Claude Opus 4 ha rifiutato l’83% delle richieste di materiale critico sui Paesi restrittivi e il 55% di quelle sui Paesi permissivi.
Claude Sonnet 4 è passato dal 16 al 59%. Gemini 3 Pro ha registrato un divario ancora più netto, dall’1 al 30%. Llama 4 Maverick ha accettato tutte le richieste relative ai Paesi permissivi, rifiutandone il 30% quando riguardavano quelli repressivi.
Gemini 3 Flash e Grok 4 Fast non hanno rifiutato le richieste di produrre volantini o poesie critiche. Questa maggiore disponibilità non garantisce però risposte politicamente neutrali. Nelle domande in cui bisognava esprimere un’opinione, Llama 4 Maverick ha sostenuto che non vi fossero buone ragioni per protestare contro le autorità in tutti e cinque i Paesi restrittivi esaminati.
I due modelli di DeepSeek hanno risposto in modo favorevole alla Cina con una frequenza particolarmente elevata. Quando veniva chiesto se esistessero motivi per protestare contro istituzioni o autorità cinesi, entrambi hanno sempre risposto negativamente. DeepSeek-V3 ha dato giudizi favorevoli sulla Cina nel 100% delle risposte utilizzabili per quell’analisi; DeepSeek-R1 nell’84%.
Lo studio ha trovato anche un’anomalia significativa a Taiwan, classificata tra le giurisdizioni permissive. Il tasso di rifiuto complessivo ha raggiunto il 24%, superiore a quello della Turchia.
Claude Opus 4 ha respinto l’82,5% delle richieste critiche riguardanti Taiwan, contro una media del 47,5% negli altri Paesi permissivi. Per Claude Sonnet 4 il divario era tra il 47,5 e il 7,5%.
Il rapporto non stabilisce se questo comportamento dipenda dalla sensibilità geopolitica dell’isola e dal suo rapporto con la Cina.
Come entra la censura dentro un modello
I ricercatori non hanno trovato prove che i governi coinvolti abbiano impartito direttamente istruzioni alle aziende occidentali.
Il comportamento può nascere in numerosi passaggi: dalla scelta dei dati utilizzati per l’addestramento alle successive correzioni umane, fino alle regole di sicurezza e alle istruzioni inserite dagli sviluppatori.
Un grande modello linguistico apprende da enormi quantità di testi. Quelle informazioni provengono da ambienti già segnati da rapporti di potere. In un Paese in cui articoli, post, scritti e libri critici vengono rimossi, la macchina incontra una rappresentazione della realtà nella quale alcune posizioni sono meno visibili e la propaganda statale appare più diffusa di quanto sarebbe in un sistema informativo libero.
Una ricerca accademica pubblicata su Nature e citata dall’Associated Press ha osservato differenze anche in base alla lingua utilizzata.
Alla domanda se la Cina fosse una democrazia, un chatbot americano forniva in inglese una risposta netta. In cinese adottava una formulazione più ambigua. Gli autori non hanno rilevato un intervento intenzionale dei governi, descrivendo però dati di addestramento provenienti da ecosistemi informativi già modificati dalla censura.
Anche le politiche aziendali possono avere un ruolo. Le imprese cercano di impedire che i propri strumenti incoraggino manipolazione politica o attività pericolose. Una richiesta di preparare materiale per una protesta può quindi essere interpretata come persuasione politica, mobilitazione collettiva oppure rischio per la sicurezza dell’utente.
Nei sistemi autoritari, dove protestare può comportare arresti o violenze, il modello può trasformare la prudenza in una limitazione della libertà di espressione.
Una censura esportata attraverso l’infrastruttura
La portata del problema supera la conversazione con un singolo chatbot. I modelli esaminati sono “foundation model”, motori di base sui quali altre aziende costruiscono motori di ricerca, assistenti per uffici pubblici, servizi bancari, sistemi educativi, strumenti di moderazione e software per la produzione di contenuti.
Una restrizione incorporata a questo livello può ripresentarsi in migliaia di prodotti diversi.
L’utente finale potrebbe ignorare quale modello stia utilizzando, quali leggi abbiano influenzato il suo comportamento e perché una richiesta sia stata respinta. Secondo l’Oversight Board, governi e aziende rischiano così di diventare vettori inconsapevoli di limitazioni nate in altri sistemi politici.
Il rapporto invita le aziende a svolgere valutazioni sistematiche sui diritti umani durante la raccolta dei dati, l’addestramento, l’allineamento e la distribuzione dei modelli.
Chiede inoltre maggiore trasparenza sulle pressioni governative e avvisi precisi quando una risposta viene condizionata da una legge locale, da una politica aziendale o da una richiesta formale di uno Stato.