Le IA “nazionali” non passano l’esame di italiano. Quelle americane le stracciano
di Filippo SantelliROMA – Immaginate un grande concorso pubblico, di quelli con la sala piena di candidati. Un concorso come quelli per entrare nella Polizia, diventare insegnanti o presidi, manager della Pubblica amministrazione, con i quizzoni di lingua e cultura italiana, le domande su Dante e sul monte più alto della Basilicata, il complemento da riconoscere e il sinonimo da trovare. Ora immaginate la sorpresa il giorno della pubblicazione dei risultati: i candidati italiani hanno a malapena raggiunto la sufficienza, mentre quelli stranieri, americani in particolare, sono in cima alla graduatoria con punteggi vicini alla perfezione.
Il quizzone di italiano
Impossibile? E invece è proprio quello che è successo in uno specialissimo concorso creato da un gruppo di ricercatori del…
ROMA – Immaginate un grande concorso pubblico, di quelli con la sala piena di candidati. Un concorso come quelli per entrare nella Polizia, diventare insegnanti o presidi, manager della Pubblica amministrazione, con i quizzoni di lingua e cultura italiana, le domande su Dante e sul monte più alto della Basilicata, il complemento da riconoscere e il sinonimo da trovare. Ora immaginate la sorpresa il giorno della pubblicazione dei risultati: i candidati italiani hanno a malapena raggiunto la sufficienza, mentre quelli stranieri, americani in particolare, sono in cima alla graduatoria con punteggi vicini alla perfezione.
Il quizzone di italiano
Impossibile? E invece è proprio quello che è successo in uno specialissimo concorso creato da un gruppo di ricercatori dell’Università Bicocca per testare intelligenze non umane, intelligenze artificiali (Seveso, Potertì, Federici, Mezzanzanica, Mercorio; ITALIC: An Italian Culture-Aware Natural Language Benchmark). Il benchmark che hanno creato, nome in codice ITALIC, è composto da 10 mila domande di lingua e cultura opportunamente selezionate dai grandi test pubblici del nostro Paese. E la graduatoria che ne è risultata è inequivocabile, spiega Fabio Mercorio, professore di Computer Science alla Bicocca e tra gli autori del progetto: “I modelli italiani sono peggiori e con un gap significativo in tutte le varie competenze analizzate”.
America straccia Italia
La graduatoria, allora. Che siano progetti “pubblici” come Minerva della Sapienza o di aziende private come Modello Italia (iGenius), Velvet (Almawave) o Miia (Fastweb, non testato dai ricercatori della Bicocca ma da un’azienda terza), che siano addestrati ex novo o ricavati da altri modelli aperti come Llama o Mistral e poi affinati sulla lingua di Dante, nessuno dei modelli tricolori va oltre i 70 punti. Con uno scarto di almeno dieci rispetto ai campioni internazionali: il modello large della francese Mistral, Llama di Meta e Gemini di Google, tutti oltre gli 80 punti, fino a Gpt-4o di OpenAi e Calude 3.5 Sonnet di Anthropic che superano i 90. Statunitensi di passaporto, ma veri italianisti.
Un bravo medico americano
La spiegazione di questo risultato è abbastanza intuitiva e sta nella differente dimensione (cioè potenza “di base”, ma anche costo di addestramento) dei vari modelli. Quelli italiani viaggiano tra i 7 e 14 miliardi di parametri, quelli americani uno o due ordini di grandezza sopra. “Sono addestrati su un numero incredibilmente ampio di dati, all’interno dei quali c’è anche l’italiano –spiega Mercorio – sono come dei bravissimi medici americani, e avendo imparato a tradurre sono bravissimi anche in Italia”.
Quanto conta l’italianità?
E i medici italiani? Mercorio assicura che l’obiettivo di Italic non è liquidarli, bensì creare uno standard oggettivo e aperto, il primo del suo genere, per permettere a tutti di valutarne l’evoluzione e la distanza dai primi della classe. Ma è chiaro che in un momento in cui le IA “italiane” si moltiplicano, e provano a conquistarsi fondi e clienti anche promettendo una maggiore competenza linguistica e culturale rispetto a quelle straniere, una distanza del genere in un test di lingua e cultura solleva un dubbio strutturale: considerato che la differenza di risorse economiche – quindi di dimensioni e potenza base – resterà, uno specifico addestramento sull’italiano basterà mai a colmare il gap?
Campioni nazionali
E’ una domanda chiave per le aziende italiane che nei prossimi anni si dovranno dotare di strumenti di IA e dovranno scegliere (si spera, con le competenze adeguate e criteri quanto più possibile oggettivi) se affidarsi a soluzioni straniere o italiane, proprietarie o aperte. Ma è una domanda chiave anche per una strategia nazionale che finora, almeno nelle parole del governo Meloni, ha molto puntato sulla creazione di uno o più campioni nazionali. “In Italia non vedo realtà in grado di competere con i grandi player americani e pensare di recuperare il terreno da soli è illusorio – dice Mercorio –: se davvero la riteniamo una questione strategica bisogna almeno unirsi a livello europeo”.