OpenAI ha annunciato l’introduzione di un watermark nei testi generati da ChatGpt e Codex nell’Unione europea. La funzione verrà attivata gradualmente nelle prossime settimane e interesserà i contenuti compatibili prodotti dagli utenti, indipendentemente dal piano utilizzato.
Per chi usa i modelli OpenAI attraverso le API, il watermark è già disponibile su alcuni modelli anche fuori dall’Europa. In questo caso, però, spetta allo sviluppatore decidere se attivarlo, infatti, la funzione è disabilitata come impostazione iniziale.
La scelta porta anche nel testo una logica di provenienza già usata per immagini e audio e risponde agli obblighi europei sulla trasparenza dei contenuti generati dalle IA.
La tecnologia scelta da OpenAI si chiama textGrain. In pratica, il sistema inserisce nel testo una sorta di impronta invisibile mentre ChatGPT sta scrivendo la risposta. Ogni volta che il modello deve scegliere la parola successiva, oppure una parte di parola, ha davanti diverse alternative possibili. textGrain, come si legge nel rapporto tecnico pubblicato da OpenAI, modifica leggermente queste scelte favorendo alcune opzioni rispetto ad altre, secondo uno schema definito da una chiave segreta.
Per chi legge, il testo appare del tutto normale. La differenza emerge solo analizzando molte parole insieme. Infatti, su un testo abbastanza lungo, le scelte effettuate dal modello formano una sequenza statistica riconoscibile. Un apposito rilevatore può quindi cercare questo schema e stimare se il testo è stato generato da un sistema OpenAI dotato di textGrain.
AI Act, tutte le nuove norme in vigore dal 2 agosto e gli obblighi invece rinviati
Il watermark di OpenAI e l’AI Act
La cornice giuridica è l’articolo 50 dell’AI Act, applicabile dal 2 agosto 2026. La norma chiede ai fornitori di sistemi generativi di marcare audio, immagini, video e testi in formato leggibile dalle macchine e di renderli riconoscibili come contenuti artificiali o manipolati, entro i limiti della fattibilità tecnica, dello stato dell’arte e dei costi di implementazione.
Il Codice europeo di buone pratiche sulla trasparenza dei contenuti generati dall’IA spiega come applicare concretamente le regole previste dall’AI Act. Le aziende possono aderire volontariamente al Codice, mentre gli obblighi fissati dall’articolo 50 derivano direttamente dalla legge europea.
Tra questi obblighi rientra anche la trasparenza sui testi generati dalle IA e pubblicati per informare il pubblico su temi di interesse generale. In questi casi occorre indicare che il contenuto è stato prodotto o modificato da un sistema di intelligenza artificiale. L’esenzione scatta quando il testo passa attraverso una revisione umana o un controllo editoriale e una persona o un’organizzazione assume la responsabilità della pubblicazione.
Quanto regge il watermark
L’efficacia del watermark dipende soprattutto da due fattori, ossia la lunghezza del testo e la libertà che il modello ha nella scelta delle parole. Più il testo è lungo e ricco di alternative linguistiche, più il segnale statistico inserito da textGrain diventa facile da riconoscere.
Nei test pubblicati da OpenAI, impostando il rilevatore in modo che produca al massimo l’1% di falsi allarmi, il watermark è stato riconosciuto in circa l’80% dei testi lunghi 200 token e in circa il 95% di quelli da 400 token in settori quali la psicologia. Un token corrisponde, in modo approssimativo, a una parola o a una parte di parola. In discipline come la matematica l’efficacia diminuisce, perché formule, numeri e passaggi logici lasciano al modello meno possibilità di scegliere tra parole diverse e quindi meno spazio per inserire il segnale.
Il watermark diventa inoltre più difficile da individuare quando il testo viene riscritto. Nelle prove svolte su testi in inglese di 400 token, sostituendo con sinonimi il 10% delle parole, il tasso di rilevamento è sceso da circa il 92% al 66%. Con la sostituzione del 25% delle parole è arrivato al 17%.
Il detector parte con accesso limitato
OpenAI aprirà il rilevatore a ricercatori approvati e organizzazioni esperte attraverso candidature valutate caso per caso. La disponibilità iniziale punta a raccogliere dati sull’affidabilità reale e a definire modalità d’uso compatibili con il rischio di falsi positivi e falsi negativi. Per immagini e audio, invece, gli strumenti di verifica restano accessibili attraverso il servizio Verify e la Content Provenance API.
Un rilevamento positivo indica che un sistema OpenAI ha probabilmente generato o elaborato almeno una parte del testo. Proprietà intellettuale, responsabilità, accuratezza, quota di contributo umano e identità dell’utente restano questioni separate. Il watermark contiene un’informazione di provenienza tecnica e il detector produce una valutazione statistica.
Un indizio di provenienza
Come detto, per i testi generati da ChatGpt nell’Unione europea, OpenAI utilizza textGrain che inserisce un segnale statistico direttamente nel modo in cui il modello sceglie le parole. Per immagini e altri contenuti multimediali OpenAI utilizza anche le Content Credentials basate sullo standard C2PA, cioè informazioni sulla provenienza incorporate nei metadati del file. A queste tecnologie si aggiungono watermark invisibili come SynthID e strumenti che permettono di verificare la presenza di questi segnali.
Mentre i metadati C2PA possono andare persi quando un file viene modificato, convertito o condiviso, un watermark incorporato direttamente nel contenuto può resistere ad alcune trasformazioni. Per questo OpenAI parla di un approccio “a più livelli”, laddove diversi sistemi vengono usati insieme perché ciascuno presenta punti di forza e limiti propri.
Nel caso dei testi, textGrain serve soprattutto a fornire un indizio sulla loro origine. Se il rilevatore trova il segnale, può stabilire che un sistema OpenAI ha probabilmente partecipato alla generazione o alla modifica del testo. Da quel segnale, da solo, restano fuori altre informazioni quali, per esempio, chi ha scritto il prompt, quanto lavoro umano è intervenuto dopo la generazione e se ciò che contiene è corretto.
La mossa di Anthropic
Anthropic ha scelto una strada analoga per i modelli IA della famiglia Claude, facendo ricorso a una filigrana statistica invisibile nei testi dei modelli compatibili.Il segnale segue il testo anche dopo copia e incolla e la sua rilevabilità cresce con la lunghezza e con la libertà lessicale disponibile durante la generazione.
Nel caso di Anthropic, sono nati strumenti studiati per cancellare il watermark che hanno messo in discussione la solidità delle filigrane.