Daejon Labrayae Love e Taylor Jamie Chan hanno messo in piedi una truffa da 1,3 milioni di dollari ingannando almeno 26 donne conosciute per lo più su app di incontri. Love si presentava come giocatore della squadra di football americano San Francisco 49ers o come ricco immobiliarista svizzero, mentre Chan fingeva di essere il suo consulente finanziario.
Insieme, come riporta la testata Futurism, convincevano le vittime a investire in opportunità fasulle e a volte persino a concedere loro dei prestiti. Love alimentava la propria falsa identità con una presenza ossessiva sui social, generando una massa di contenuti ingannevoli che veniva riassunta come vera dai motori di ricerca e dagli AI Overviews di Google, i riepiloghi generati dalle IA che compaiono in cima ai risultati di ricerca e sintetizzano le informazioni provenienti da più fonti web.
Un episodio degno di un romanzo di scarsa qualità che, però, mette in evidenza come la disinformazione diffusa sui social possa contaminare gli strumenti di ricerca basati sulle IA, creando un ambiente in cui le bugie ben costruite vengono amplificate invece che smascherate. Argomento che abbiamo approfondito con Federica Maria Francesca Paci, professoressa associata, esperta in Cyber sicurezza e Protezione dei dati del dipartimento di Informatica dell’Università di Verona.
La parte per il tutto
Se due individui sono riusciti a produrre una quantità di dati tale da alterare le fonti, cosa possono fare gruppi di individui più organizzati e aziende che avessero interesse a trasmettere un’immagine distante da quella reale?
“I due truffatori non hanno adottato tecniche di attacco sofisticate per ingannare le loro vittime – spiega la professoressa Paci – I due presunti truffatori hanno costruito e alimentato nel tempo una falsa identità digitale, pubblicando su Instagram, TikTok e LinkedIn contenuti nei quali uno di loro si presentava come giocatore infortunato dei San Francisco 49ers o come facoltoso imprenditore svizzero. La reiterazione di immagini artefatte e informazioni coerenti con il personaggio inventato ha creato online un’apparenza di credibilità. Il meccanismo di recupero delle informazioni di AI Overviews ha poi agevolato i truffatori: in risposta a una ricerca, seleziona un insieme limitato di contenuti ritenuti pertinenti, ne sintetizza le informazioni e produce un testo unitario, corredato dai collegamenti alle fonti. Se le pagine recuperate ripetono tutte la stessa narrazione manipolata, la risposta generata viene presentata come se fosse confermata da più fonti indipendenti. Chi cerca informazioni rischia quindi di ritrovare nella risposta dell’IA la medesima storia costruita dai truffatori e di interpretarla come una verifica autorevole. Il problema, quindi, non riguarda soltanto la quantità dei contenuti pubblicati, ma anche la capacità del sistema di IA di verificarne la provenienza, la qualità, l’integrità e l’effettiva indipendenza. Se due individui sono riusciti ad alimentare una falsa identità sufficientemente credibile da sostenere una frode di queste dimensioni, un’organizzazione dotata di maggiori risorse potrebbe rendere la manipolazione molto più estesa e sofisticata, combinando siti web, account social, comunicati, contenuti sponsorizzati, reti di profili e tecniche di ottimizzazione per i motori di ricerca. Ad esempio, un’azienda potrebbe cercare di ridurre la diffusione di informazioni potenzialmente dannose per l’immagine e la reputazione aziendale. Gruppi organizzati, invece, potrebbero influenzare l’opinione pubblica su temi politici, sanitari o finanziari o diffondere notizie false”.
Poche informazioni manipolate possono cambiare una risposta
Quando si inganna un’IA senza intervenire sul modello o sui dati con cui è stato addestrato, si può parlare di avvelenamento delle fonti idea che, nella letteratura di settore, viene chiamata con definizioni quali knowledge base poisoning, knowledge poisoning o retrieval poisoning, a seconda del tipo di sistema e della tecnica usata.
Il principio comune è lo stesso, ovvero introdurre informazioni costruite appositamente fra quelle che la macchina potrebbe recuperare, affinché vengano utilizzate per produrre una determinata risposta.
Il problema riguarda soprattutto i sistemi basati sulla RAG, Retrieval-Augmented Generation, ossia i sistemi grazie ai quali un’IA cerca informazioni in fonti esterne prima di formulare la risposta. È il meccanismo usato, per esempio, dalle AI Overviews e da AI Mode di Google e da Microsoft Copilot Studio.
Anche servizi come Perplexity e ChatGpt Search seguono lo stesso principio generale, recuperando informazioni dal web al fine di usarle per costruire la risposta ed è qui che si insinua il rischio. Se tra le fonti recuperate entra un contenuto manipolato, anche la risposta dell’IA può esserne condizionata.
Bastano 250 documenti per avvelenare un’IA
Il rischio fake news
Per anni abbiamo combattuto le fake news nei motori di ricerca. Con i sistemi RAG rischiamo che le fake news diventino direttamente le risposte dell’IA? Così fosse, sarebbe lecito attendersi una contromisura sganciata da chi i modelli IA li sviluppa? (Anthropic, Google, OpenAI, ...)
“Sì, il rischio esiste – spiega la professoressa Paci – Un motore di ricerca tradizionale presenta una lista di risultati e lascia all’utente, almeno in parte, il compito di confrontarli. Un sistema RAG seleziona invece alcune fonti e ne produce una sintesi unica, formulata con un linguaggio fluido e autorevole. Il RAG non rende automaticamente vere le informazioni recuperate. Se il recupero seleziona documenti falsi, coordinati o manipolati, il modello può sintetizzarli correttamente dal punto di vista linguistico e tuttavia produrre una conclusione falsa. Le contromisure non possono quindi dipendere esclusivamente dai fornitori come Anthropic, Google, e OpenAI: non sarebbe prudente lasciare che chi progetta questi sistemi sia anche l’unico soggetto a misurarne l’affidabilità e la sicurezza. È necessario definire requisiti che i sistemi di IA generativa devono soddisfare e garantire una supervisione indipendente da parte di autorità pubbliche e organismi di standardizzazione, che vigilino sul rispetto di tali requisiti da parte dei fornitori. Questo è l’approccio adottato dall’Unione europea con l’AI Act, che disciplina i sistemi di IA in base al rischio che possono comportare per la salute, la sicurezza e i diritti fondamentali delle persone. Gli obblighi variano in base al tipo di sistema e al suo impiego. Per i fornitori di modelli di IA per finalità generali sono previsti, obblighi di documentazione tecnica, trasparenza sui contenuti utilizzati per l’addestramento e rispetto della normativa sul diritto d’autore. Per i modelli più avanzati, classificati come modelli a rischio sistemico, si aggiungono la valutazione e la mitigazione dei rischi, la segnalazione degli incidenti gravi, l’adozione di adeguate misure di cybersicurezza e lo svolgimento di test avversariali finalizzati a individuare vulnerabilità e comportamenti pericolosi”.
Cinque documenti in mezzo a milioni
Uno degli studi più significativi è PoisonedRAG, pubblicato nel 2025 al 34esimo USENIX Security Symposium, una delle principali conferenze internazionali sulla cybersecurity.
Per testare la vulnerabilità dei sistemi RAG, i ricercatori della Pennsylvania State University e dell’Illinois Institute of Technology hanno creato cinque documenti falsi per ogni quesito da manipolare. I documenti, costruiti per sembrare rilevanti e credibili, sono stati inseriti in raccolte composte da milioni di contenuti autentici, con l’obiettivo di verificare se l’IA li avrebbe recuperati e utilizzati nelle risposte. Quando il sistema RAG riceveva la domanda, cercava nell’archivio i testi che riteneva più utili. I documenti costruiti dagli attaccanti riuscivano spesso a finire proprio tra quelli selezionati e venivano quindi passati al modello come fonti da utilizzare per rispondere. A quel punto il modello tendeva a ripetere l’informazione falsa contenuta nei documenti. Nei test, questo procedimento ha fatto produrre al sistema la risposta scelta dagli attaccanti in circa nove casi su dieci.
Non significa che bastano cinque pagine false pubblicate sul web per controllare ChatGpt o Google. I ricercatori hanno operato in un ambiente sperimentale nel quale hanno inserito direttamente i documenti nella base consultata dal sistema. Il risultato dimostra che, se un contenuto manipolato riesce a entrare tra le fonti che l’IA considera pertinenti per una determinata domanda, anche pochi documenti possono pesare molto più di milioni di testi corretti che il sistema, per quella domanda, non recupera.
I rischi reali
A febbraio del 2026 è emersa una truffa mediante la quale, negli Usa, dei cyber criminali hanno pubblicato online numeri di telefono falsi spacciandoli per quelli ufficiali di banche e aziende. AI Overviews di Google, nel restituire risposte sintetiche basandosi su ciò che trova sul web, li ha inseriti nei suoi suggerimenti senza verificarli, così gli utenti che cercavano l’assistenza clienti finivano a chiamare direttamente i truffatori.
Tuttavia, i fatti a oggi disponibili, non indicano che oggi sia possibile disseminare il web di pagine false e controllare sistematicamente le risposte di ChatGpt, Gemini o Google. Dimostrano qualcosa di più circoscritto che rappresenta però un rischio che porta con sé delle conseguenze, come spiega la professoressa Paci: “Il rischio è concreto, ma varia in funzione del contesto in cui il sistema di IA viene utilizzato, della possibilità che soggetti esterni influenzino i dati a cui attinge e dell’impatto delle risposte generate. È relativamente contenuto, ad esempio, nel caso di un assistente che riassume manuali tecnici conservati in un archivio aziendale chiuso, controllato e versionato: le fonti non possono essere facilmente manipolate dall’esterno e l’utente può verificare subito la risposta nel documento originale. Il rischio diventa invece elevato nei sistemi che costruiscono profili reputazionali o supportano decisioni finanziarie, professionali o personali, recuperando automaticamente informazioni dal web e dai social network, come nel caso dei due truffatori. In questi casi, un soggetto malintenzionato può pubblicare numerosi contenuti coordinati e indurre il sistema a presentarli come conferme indipendenti, soprattutto quando esistono poche fonti autorevoli con cui confrontare quelle manipolate. Non bisogna però concludere che ogni sistema di IA sia facilmente controllabile o che tutte le risposte siano inaffidabili. Le manipolazioni possono essere rilevate confrontando fonti realmente indipendenti, privilegiando registri e documenti istituzionali, analizzando l’origine temporale dei contenuti e verificando se molte pagine apparentemente diverse dipendano dalla stessa fonte. Quanto più rilevanti sono le conseguenze di una decisione, tanto maggiore deve essere il livello di verifica delle risposte generate”.