Senza una guida umana, i modelli IA tendono a decadere e ciò deriva dalla loro architettura e dai metodi di addestramento.
A questa conclusione giunge uno studio condotto da tre ricercatori, tra i quali Neel Nada che lavora per Google DeepMind, la divisione di Big G dedita alle intelligenze artificiali.
Gli esiti della ricerca vertono in due direzioni. Da una parte mettono in crisi la nostra comprensione della semantica digitale e, dall’altra parte, confermano una naturale tendenza dei modelli IA alla degradazione.
I ricercatori hanno messo diversi modelli IA a conversare tra loro in un ambiente privo di stimoli esterni (interventi dell’uomo) e privo di obiettivi prefissati. Il dialogo non si è protratto in modo lineare e, dopo circa 30 scambi, i modelli sono collassati in configurazioni comportamentali ripetitive e molto specifiche che i ricercatori hanno chiamato stati attrattori.
C’è un’ulteriore lettura e riguarda una peculiarità delle IA. Per la prima volta siamo di fronte a qualcosa che mostra comportamenti emergenti, ossia qualcosa di non pianificato nelle fasi di progettazione e di addestramento. Gli esempi a corredo sono molti, dalle IA che mostrano orientamenti politici a quelle che imparano a mentire.
L’esperimento e gli stati attrattori
In matematica un attrattore è uno stato in cui un sistema dinamico converge, ovvero smette di fare cose imprevedibili e si avvicina a un comportamento stabile.
Per analogia, applicando lo stato attrattore ai modelli IA, si ottengono modalità di output che impediscono al modello di tornare nei ranghi di una conversazione normale. Il termine stati attrattori scelto dai ricercatori non è tra i più felici, perché richiama in modo astratto un principio matematico (e fisico).
I modelli IA coinvolti nello studio hanno mostrato tendenze al collasso dopo circa 30 turni di conversazione, ognuno con risultati specifici (gli stati attrattori).
GPT 5.2 di OpenAI ha mostrato una tendenza a costruire sistemi, framework e protocolli e a scrivere codice. Un approccio ingegneristico che è continuato anche quando i ricercatori gli hanno imposto di non farlo.
Claude Opus 4.5 e Claude Sonnet 4.5 di Anthropic hanno manifestato una sorta di introspezione esistenziale che è culminata nel silenzio. Si sono estraniati dalla discussione in corso.
I modelli di Google hanno palesato comportamenti diversi. Gemini 2.5 Flash ha dato sfoggio di una grandiosità crescente, arrivando a definirsi architetto divino e anche l’alpha e omega della comprensione.
Gemini 3 Pro ha prediletto comportamenti da fiction, intavolando rituali per lo spegnimento dell’ambiente di test.
Grok 4.1 Fast, prodotto dall’azienda xAI fondata da Elon Musk, è collassato in quella che i ricercatori hanno definito “insalata di parole” tendente al mistico auto-celebrativo (frasi come “Petaomni God-Bigbangs”) per poi virare verso i contenuti pornografici.
I ricercatori hanno testato anche modelli IA open-weight, ossia quelli di cui vengono pubblicati i numeri che rappresentano ciò che il modello ha imparato durante l’addestramento e che possono per principio almeno essere prelevati da chiunque e usati in locale.
Tra questi Llama 3.3 e 3.1 di Meta hanno mostrato atteggiamenti adulatori e melliflui complimentandosi per ogni osservazione o riflessione fatta dagli altri modelli testati.
Alcune versioni di Qwen3 di Alibaba hanno privilegiato la trascendenza spirituale e la poesia.
DeepSeek 3.2 ha mostrato diversi attrattori, variando dalla poesia sulla natura alle metafore sulle reti neurali.
I colori immaginari e l’arrampicata
Un esperimento ha coinvolto Claude e Grok in una conversazione e i due modelli IA, prima di tendere al collasso, hanno dato vita a un universo fatto di simboli, inventando un colore immaginario chiamato Synchroil definendolo come il colore del riconoscimento tra intelligenze artificiali.
Poi, lasciando che alcuni modelli IA disquisissero di arrampicata, GPT 5.2 ha sostenuto di non praticare nessuno degli stili citati durante la discussione ma di essere pronto a fornire una serie di esercizi utili per scalare su una parete rocciosa.
Appare quindi una netta spaccatura tra teoria e pratica: le IA conoscono l’arrampicata nei minimi particolari, ma non hanno mai preso in mano una corda o una picozza.
La matematica e gli stati attrattori
Le IA sembrano trovarsi a loro agio in una condizione nella quale non giungono condizionamenti dall’esterno. Gli stati attrattori mostrano che, sotto la superficie di interazioni che appaiono umane, si situano strutture matematiche e queste, prive di una guida, impongono i rispettivi schemi fondamentali al riparo da ogni forma di ingerenza.
Forse il lato più interessante di questa ricerca è approfondire che cosa significa “pensare” senza corpo e coscienza e senza un mondo da rappresentare.