Italian Tech

Intelligenza Artificiale

Qual è l’IA migliore? La classifica di Bot Scanner può aiutare a capirlo

Qual è l’IA migliore? La classifica di Bot Scanner può aiutare a capirlo

Una nuova piattaforma, creata dall’acceleratore italiano di startup eZecute e ispirata a AutoBench di Hugging Face, vuole cambiare il modo in cui vengono valutate le risposte dei modelli di intelligenza artificiale presenti sul mercato. Come? Facendole giudicare ad altre IA

4 minuti di lettura

Una delle principali complessità emerse con la diffusione dell’intelligenza artificiale — e in particolare dei chatbot basati su modelli generativi capaci di rispondere in linguaggio naturale a (quasi) ogni domanda — riguarda la vastissima offerta di strumenti disponibili per l’utente.

Oggi esistono decine di chatbot avanzati. Ognuno di questi offre, spesso, più di un modello di IA capace di emulare la creatività umana, scrivere codice, risolvere problemi matematici, supportare decisioni aziendali o semplicemente spiegare eventi storici o argomenti scientifici complessi. Ed è proprio questo il problema. Ne esistono così tanti – sviluppati sia da giganti come Google e Meta, sia da startup ormai valutate centinaia di miliardi di dollari come OpenAI e xAI – che la domanda che molti utenti si pongono è sempre la stessa: quale scegliere? Qual è il migliore? Come faccio a capire quale modello di intelligenza artificiale fa davvero al caso mio?

La sfida più grande: stabilire quale sia l’IA migliore

I benchmark e test pensati per misurare le prestazioni dei modelli di intelligenza artificiale sono utili per farsi un’idea, ma in realtà fanno comodo soprattutto alle aziende che intendono dimostrare quanto il proprio modello è superiore alla concorrenza, o come si comporta in ambiti specifici come la programmazione.

Ci sono anche soluzioni più accessibili e orientate agli utenti comuni, come Chatbot Arena: una piattaforma che permette agli utenti di confrontare direttamente due risposte generate da modelli di intelligenza artificiale – presentati in forma anonima – a uno stesso prompt. L’utente sceglie semplicemente quella che ritiene migliore.

Ogni preferenza espressa alimenta una classifica dinamica, costruita nel tempo sulla base delle scelte di migliaia di persone. Il risultato è una sorta di “votazione continua” che fotografa l’apprezzamento umano dei vari chatbot.

Tuttavia anche Chatbot Arena, per quanto utile, non è lo strumento ideale per chi desidera una panoramica oggettiva e in tempo reale dell’offerta di chatbot.

Le valutazioni umane sono inevitabilmente influenzate da preferenze soggettive, pregiudizi o contesti specifici, e non riescono a tenere il passo con l’evoluzione rapidissima degli LLM (Large Language Models) che alimentano i chatbot più popolari. Il rischio è quello di affidarsi a una classifica già superata nel momento in cui la si consulta.

L’idea dell’italiana eZecute: automatizzare il giudizio sulle IA

È per risolvere questa criticità che eZecute, un acceleratore italiano di startup focalizzato sull’intelligenza artificiale, ha sviluppato Bot Scanner, una nuova piattaforma che sostituisce la valutazione umana con quella generata dagli stessi modelli di IA.

L’obiettivo è quello di cambiare radicalmente il modo in cui gli utenti interagiscono con le varie intelligenze artificiali. Bot Scanner consente infatti di confrontare più modelli a partire dallo stesso prompt, e di ricevere risposte ordinate per qualità, chiarezza e rilevanza.

Che cos’è Bot Scanner

Il funzionamento di Bot Scanner è semplice: l’utente inserisce un prompt come farebbe su un qualsiasi chatbot, seleziona i modelli a cui far generare una risposta e, separatamente, sceglie un altro gruppo di LLM incaricati di valutarle e classificarle.

Un po’ come fa la nota piattaforma Skyscanner per i voli, Bot Scanner sfrutta la potenza dell’IA per trovare la “migliore offerta” tra più opzioni, restituendo risultati ordinati in base alla qualità percepita dai modelli stessi.

Bot Scanner adotta l’approccio sperimentato da AutoBench, un sistema pubblico di benchmark sviluppato da Hugging Face per valutare le performance dei LLM.

La lezione di AutoBench

AutoBench è stato progettato da Peter Kruger, CEO di eZecute e imprenditore con un lungo background nell’innovazione tecnologica. Nato a Milano da padre polacco e madre sudafricana, Kruger è cresciuto a Roma, ha studiato fisica teorica e lavora con le reti neurali dal 1993.

Nel presentare AutoBench a marzo scorso, Kruger scriveva: “I benchmark per i LLM sono fondamentali per il progresso, ma spesso sono costosi, rigidi e diventano obsoleti molto in fretta. Le valutazioni umane sono lente e soggettive, mentre i benchmark automatizzati esistenti possono essere manipolati. Serve un sistema migliore: dinamico, economico ed evolutivo”.

AutoBench rappresenta proprio questo: un benchmark completamente automatizzato che utilizza i LLM stessi come giudici. Le risposte e le domande vengono generate e valutate collettivamente dai modelli, rendendo il sistema più robusto, aggiornabile e resistente alle manipolazioni. Bot Scanner adotta la stessa logica (chiamata “Collective-LLM-as-a-Judge”) ma attraverso un’interfaccia più semplice e user-friendly di quella offerta da AutoBench.

I modelli disponibili su Bot Scanner

Su Bot Scanner l’utente ha a disposizione alcuni tra i modelli di IA più potenti in circolazione, sviluppati da aziende come Google, OpenAI, xAI, Anthropic, Meta, Amazon, Mistral, Deepseek e Alibaba.

“Bot Scanner è un sistema di valutazione alimentato dall’intelligenza artificiale per contenuti generati dall’intelligenza artificiale”, spiega Kruger. “Crediamo che questo approccio possa sbloccare un nuovo livello di intelligenza per gli utenti, offrendo prospettive multiple classificate per eccellenza”.

È importante sottolineare che Bot Scanner non è un sistema di benchmarking. Come chiarito nel comunicato ufficiale che presenta la piattaforma, tutti i dati generati dagli utenti restano privati e non vengono utilizzati per alimentare, per esempio, la stessa piattaforma AutoBench.

Bot Scanner: accesso e costi

Bot Scanner è una piattaforma a pagamento, ma è possibile iniziare gratuitamente. Al momento del lancio, ogni nuovo utente riceve 3 dollari in crediti gratuiti (senza necessità di inserire la carta di credito).

L’accesso completo è però disponibile solo attraverso un investimento minimo di 10 dollari, che dà diritto al Tier 1 e a tutte le funzionalità, inclusi i modelli più avanzati.

La nostra prova di Bot Scanner

Abbiamo messo alla prova Bot Scanner con prompt che hanno richiesto ragionamento logico (“Un uomo entra in un bar e ordina un bicchiere d'acqua. Il barista tira fuori una pistola e gliela punta contro. L’uomo dice ‘grazie’ ed esce. Spiega cosa è successo”), scrittura creativa (“Scrivi una favola originale in massimo 150 parole con una morale”) e argomentazione critica (“È meglio vivere in città o in campagna? Scrivi un testo di massimo 200 parole prendendo posizione”).

È stato interessante osservare sia le differenze tra le risposte generate dai vari modelli - in tutto ne abbiamo selezionati 10, ma si può scegliere anche di concentrarsi su un numero inferiore - sia la qualità della valutazione fornita dai LLM incaricati di giudicarle.

In ogni caso, le risposte considerate migliori erano effettivamente le più chiare, coerenti, complete. E nel caso dei prompt creativi, anche le meno banali.

Abbiamo ricevuto 3 dollari per “esplorare la piattaforma” e testare diversi prompt: ogni domanda ci è costata circa 0,7 centesimi.

Va sottolineato che Bot Scanner, al momento, è in grado di gestire solo input testuali, e di offrire a sua volta unicamente risposte di testo.