I token sono i nuovi dollari. Questo è il motivo di fondo per il quale OpenRouter è stata acquisita da Stripe, piattaforma americana che consente alle aziende di accettare pagamenti online, gestire incassi, abbonamenti e fatturazione tramite API.
Le API sono interfacce che permettono a un software di comunicare con un modello di intelligenza artificiale, inviando richieste e ricevendo risposte. L'utilizzo delle API è generalmente a pagamento e i costi dipendono dal numero di token elaborati, cioè dalle unità minime di testo utilizzate dal modello per processare input e generare output.
Confrontare i prezzi applicati dai provider di servizi IA può sembrare facile e, almeno a una prima lettura, può sembrare sufficiente prendere la tariffa per un milione di token, ordinarla per ordine di costo e scegliere quella più conveniente. In realtà la questione è un po’ più sottile e, per proporre un quadro più chiaro, abbiamo fatto leva su quattro comparatori di costi, ossia Artificial Analysis, OpenRouter Models, AI API Prices e CheapestInference che mostrano logiche differenti e non possono essere usati come copie uno dell’altro.
Il costo dell’inferenza
L’inferenza è la fase in cui un modello già addestrato viene effettivamente usato. Include le richieste che riceve, la loro elaborazione e le risposte restituite all’utente.
I token servono a misurare una parte di questo lavoro ma, da soli, contribuiscono soltanto in parte a determinare il prezzo, ed è ogni provider a stabilire le proprie logiche commerciali.
Per esempio, OpenAI (che produce ChatGpt), Anthropic (Claude) e Google (Gemini) applicano tariffe diverse a seconda del modello, distinguono tra token di input, output e cache e possono prevedere prezzi differenti per elaborazioni batch, modalità più veloci o prioritarie e strumenti aggiuntivi come la ricerca sul web. In parole semplici, l’inferenza genera un consumo che il provider decide come misurare e fatturare.
I comparatori non sono tutti uguali
Rimanendo ancorati ai quattro comparatori scelti, va detto che Artificial Analysis affianca al prezzo misure di qualità, velocità e tempi di risposta per arrivare a calcolare un costo medio per compito nei propri test standardizzati.
OpenRouter funge anche da intermediario, perché permette di vedere e usare offerte di operatori diversi che forniscono l'accesso allo stesso modello (i provider). AI API Prices privilegia una tabella ordinabile e un calcolo rapido e, infine, CheapestInference aggiunge la dimensione che manca agli altri, prendendo in esame anche l'andamento dei listini nel tempo.
Se ne può dedurre che un confronto corretto non inizia dal prezzo, ma dall'obiettivo. Si vuole spendere meno, ottenere risultati migliori con lo stesso budget, individuare il provider più rapido o analizzare l'andamento delle tariffe? A ogni esigenza corrisponde un metodo di valutazione diverso. In ogni caso, nessuna stima teorica vale quanto i costi misurati sull'uso reale.
Il confronto riguarda quindi funzioni, prezzi esposti e limiti dichiarati e non può essere ridotto a una prova sperimentale eseguita sui quattro servizi con lo stesso modello. Questo dipende dal fatto che un token non è una misura universale, tant’è che modelli IA differenti possono usare logiche di tokenizzazione diverse. Il prezzo per milione di token applicato dai provider è un'unità tariffaria e non una misura universale del lavoro svolto.
Quattro strumenti, quattro usi
Tra i quattro servizi esaminati, Artificial Analysis offre il quadro più ampio. La pagina dei modelli mette in relazione costo, qualità, velocità di generazione, tempo di risposta iniziale (ovvero il tempo che intercorre tra l'invio della richiesta e l'inizio della risposta del modello) e ampiezza del contesto. Per i modelli di ragionamento distingue i token della risposta da quelli impiegati per elaborare il risultato. Nei grafici economici che restituisce, separa input ordinario, letture e scritture della cache, ragionamento e risposta.
OpenRouter Models risponde a un'altra esigenza, perché permette di confrontare le condizioni con cui lo stesso modello viene servito da operatori differenti. Le pagine mostrano prezzi per input e output, finestra di contesto e, nelle schede, disponibilità dei provider, velocità e tempi di risposta. La piattaforma dichiara di non applicare un ricarico alla tariffa d'inferenza, ma il piano a consumo prevede una commissione del 5,5% quando si acquistano i crediti. È una voce distinta che deve entrare nel computo totale.
Tra i quattro servizi esaminati, AI API Prices presenta l'interfaccia più immediata. La tabella può essere ordinata per costo di input, costo di output e finestra di contesto. Espone anche un costo di riferimento per una chiamata formata da mille token in ingresso e mille in uscita e, non da ultimo, offre un calcolatore mensile. La pagina invita a ricontrollare il listino ufficiale prima di impegnare volumi.
CheapestInference è utile quando interessa la traiettoria del prezzo e offre un rapporto aggiornato mensilmente che ricostruisce parte della serie storica dei prezzi offerti dai diversi provider. Può essere un punto di riferimento da prendere in considerazione quando è necessario avviare progetti sul lungo termine.
Le sette voci che il prezzo per milione nasconde
Le logiche di prezzo espresse secondo la metrica “per milione di token” possono sembrare semplici e chiare da decifrare ma occorre fare dei distinguo.
La prima separazione da fare è tra input e output. Nell'input rientrano il messaggio dell'utente, le istruzioni di sistema, la cronologia, i documenti e le descrizioni degli strumenti. L'output comprende ciò che il modello genera ed è spesso più caro. Un rapporto fisso, per esempio un milione di token in entrata e un milione in uscita, produce un confronto matematico ma non rappresenta necessariamente nessuna applicazione reale.
Il ragionamento aggiunge una terza voce. I modelli possono produrre token intermedi per pianificare e verificare la risposta, anche quando l'utente non li vede tutti. Google specifica nel listino della Gemini API che il prezzo dell'output include i token di ragionamento. Artificial Analysis li separa nei propri grafici per rendere leggibile il loro peso. Un comparatore che stima soltanto la lunghezza della risposta visibile può quindi sottovalutare il consumo.
La cache - che consente di riutilizzare porzioni di contesto già elaborate dal modello, riducendo tempi e costi delle richieste successive - deve essere divisa in lettura e scrittura. Leggere un contesto già elaborato può essere molto meno costoso che inviarlo di nuovo come input ordinario; memorizzarlo per il riuso può invece costare di più. Anthropic spiega nel proprio listino che una lettura dalla cache vale il 10% dell'input standard, mentre la scrittura costa 1,25 volte per una durata di cinque minuti e due volte per un'ora.
La quinta voce è la soglia del contesto lungo. Il listino OpenAI presenta, per alcuni modelli, colonne separate per contesto breve e lungo e distingue input, input dalla cache, scritture nella cache e output. La soglia varia in base al modello e alla modalità di servizio e deve essere verificata nella relativa scheda ufficiale. Quando la soglia viene superata la tariffa dell’intera richiesta può cambiare e, non da ultimo, confrontare soltanto la dimensione massima della finestra indica quanto testo può entrare, non quanto costerà usarla.
Rimangono provider e servizi accessori. Il medesimo modello IA può essere distribuito da più operatori con prezzi, limiti, velocità e politiche dei dati differenti. A ciò possono aggiungersi modalità di elaborazione, residenza regionale, ricerca sul web, uso di strumenti, archiviazione e commissioni.
OpenRouter, per esempio, separa il prezzo del provider dalla commissione di acquisto dei crediti e Google fattura alcune funzioni di collegamento a Search o Maps per numero di query. Queste voci di costo non sono convertibili in token con una formula unica.
Come costruire un confronto che regga
Il primo passo è fissare l'oggetto. Vanno registrati fornitore, nome esatto del modello, eventuale versione, provider che lo serve, modalità di elaborazione, regione, ampiezza del contesto e data del listino.
Il secondo passo è usare richieste complete e identiche. Non basta incollare il testo dell'utente, occorre includere istruzioni di sistema, cronologia, file, immagini, schemi degli strumenti e formato richiesto per la risposta. Per ogni esecuzione vanno raccolti i dati d'uso restituiti dall'API, separando input non memorizzato, letture e scritture della cache, output, ragionamento e costi degli strumenti.
Il terzo passo è scegliere compiti rappresentativi come, per esempio, estrazione di dati, assistenza clienti, traduzione, programmazione o analisi documentale.
I quattro comparatori entrano in momenti diversi di questo processo, tant’è che AI API Prices riduce rapidamente l'elenco, Artificial Analysis aggiunge qualità e prestazioni, OpenRouter aiuta a scegliere il canale di erogazione e permette una prova operativa attraverso un'interfaccia comune.
Infine, CheapestInference mostra se il listino è stabile o soggetto a cambiamenti.
Il dato decisivo è il costo del compito riuscito
Il modello più economico per milione di token non è necessariamente quello che costa meno. Può produrre più ragionamento, risposte più lunghe, errori che impongono un nuovo tentativo o risultati da correggere manualmente. Un modello più caro può invece risolvere il compito al primo passaggio e ridurre il lavoro di controllo. La fattura dipende dal consumo totale ma la reale convenienza dipende anche dalla riuscita del compito.
La metrica più utile è il costo per risultato accettato dall’utente, unendo la spesa complessiva di tutte le esecuzioni, comprese quelle fallite e ripetute, divisa per il numero di risultati che hanno superato il criterio stabilito.
La regola conclusiva può essere riassunta dall’esigenza di confrontare una struttura dei costi invece di un solo prezzo, al fine di scegliere il modello IA che completa un lavoro con la minore spesa possibile e non soltanto il modello che, sulla carta almeno, appare essere il più economico.