Anthropic ha annunciato che i nuovi modelli Claude renderanno riconoscibili i contenuti generati dall’intelligenza artificiale (IA).
I sistemi adottati sono due. Nei testi prodotti da Claude inserirà un segnale invisibile al lettore ma rilevabile attraverso un apposito software. Nei file creati dal sistema, quando il formato lo consentirà, aggiungerà invece informazioni tecniche firmate digitalmente che ne indicano la provenienza e permettono di verificare eventuali modifiche.
L’azienda guidata da Dario Amodei ha rilasciato una nota tecnica nella quale illustra il modus operandi ma non ha ancora spiegato come funzionerà il segnale inserito nei testi né ha pubblicato lo strumento necessario per rilevarlo.
I watermark non sono quindi “timbri visibili” e, ancora prima, la loro assenza non coincide per forza di cose con la totale assenza di un intervento delle IA. È una distinzione utile a capire la portata dell’annuncio che, di fatto, fa dei watermark degli indizi tecnici e non un giudice automatico di autenticità.
AI Act, tutte le nuove norme in vigore dal 2 agosto e gli obblighi invece rinviati
Un segnale nel testo, una firma nei file
Anthropic sostiene che il watermark resterà nel testo quando questo viene copiato e incollato, perché insieme alle parole viene riprodotta anche la struttura che consente di riconoscerlo. Il sistema potrebbe continuare a rilevarlo dopo piccole correzioni, mentre una riscrittura più estesa potrebbe cancellarlo.
Affermazioni che non sono ancora verificabili perché l’azienda non ha pubblicato il funzionamento tecnico del watermark, i suoi margini di errore o uno strumento pubblico per individuarlo.
La spinta dell’AI Act
La scelta arriva mentre è diventato applicabile l’articolo 50 dell’AI Act, il regolamento europeo sull’intelligenza artificiale. Dal 2 agosto del 2026, i fornitori di sistemi che generano audio, immagini, video o testi sintetici devono fare in modo che gli output siano marcati in un formato leggibile dalle macchine e riconoscibili come prodotti o manipolati dalle IA. Il testo del regolamento richiede soluzioni efficaci, interoperabili, robuste e affidabili per quanto tecnicamente possibile, tenendo conto dei limiti dei diversi contenuti e dei costi.
Indizi e non verdetti
Anthropic invoca la cautela, poiché un watermark rilevato può indicare che Claude è intervenuto, ma non prova che abbia scritto l’intero contenuto, tant’è che anche una correzione, una traduzione o un’altra operazione su un testo umano, può lasciare il segnale.
Al contrario, una riscrittura pesante, una parafrasi, una traduzione successiva o la fusione con altro materiale possono indebolirlo o cancellarlo. Un esito negativo, dunque, non autorizza a concludere che il testo sia umano.
Una prudenza fedele alla letteratura scientifica, un lavoro presentato nel 2024 alla International Conference on Machine Learning, infatti, ha mostrato che modifiche successive possono rimuovere tre schemi di watermark dai contenuti generati con le IA, con ricadute minime sulla loro qualità.
Il risultato non dimostra che il metodo di Anthropic sia già aggirabile, mostra però che nessun singolo segnale dovrebbe essere usato per stabilire con certezza se un contenuto è stato creato da un’IA.
Quella introdotta da Anthropic è una misura che va valutata per ciò che è, ossia un’infrastruttura promettente e una risposta concreta a un obbligo normativo, non una certificazione universale.