GPT-6 Astra, l'ultimo modello sviluppato da OpenAI, ha guidato una Toyota Corolla lungo un percorso a ostacoli in un parcheggio deserto, senza che un essere umano toccasse mai volante o pedali. Il test segna la prima volta che un modello linguistico di uso generale, cioè un sistema di intelligenza artificiale non addestrato specificamente per la guida, riesce a completare un tracciato reale al volante di un'automobile vera. Il percorso, lungo 130 metri e delimitato da coni stradali disposti a formare curve e restringimenti, è stato completato da Astra al secondo tentativo in 5 minuti e 22 secondi, a una velocità media di circa 1,5 km/h. Al primo tentativo, il modello si era fermato a metà strada.
I modelli IA in sfida
DrivingBench, il benchmark indipendente che ha realizzato l'esperimento, è opera dei ricercatori Tobias Gessler, Aditya Ramabadran e Simon Mahns. La sperimentazione ha messo alla guida della stessa auto quattro modelli concorrenti: oltre ad Astra, anche GPT-5.6 Sol, il modello precedente di OpenAI, Grok 4.6 di xAI e Claude Fable 5.1 di Anthropic. Gli altri tre modelli non sono riusciti a completare il percorso, la maggior parte si è fermata già alla prima curva mentre Claude Fable 5.1 ha raggiunto, nel tentativo migliore, circa la metà del tracciato.
L'automobile utilizzata nel test è stata equipaggiata con un dispositivo hardware di guida assistita che normalmente supporta il software open source openpilot, collegato tramite il bus Can (Controller Area Network, la rete elettronica interna dei veicoli) ai comandi di sterzo, acceleratore e freno. I modelli non controllano l'auto direttamente: operano attraverso tre funzioni richiamabili all'interno di una conversazione continua, secondo un protocollo specifico. Una funzione restituisce un'immagine della strada insieme a velocità e angolo di sterzata, un’altra imposta direzione e angolo di sterzata, velocità (tra 0,5 e 3,5 m/s) e durata di una manovra, mentre l’ultima aziona il freno.
Poca efficienza e costi esosi
Aditya Ramabadran, uno degli autori del progetto, ha dichiarato al quotidiano britannico The Register che l'utilizzo di un modello linguistico generico per la guida reale "oggi non è assolutamente pratico". L'auto ha proceduto a velocità estremamente ridotte durante il test, con un operatore umano pronto a frenare in ogni momento. La latenza del modello, cioè il tempo necessario a elaborare ogni decisione, è stata secondo Ramabadran il principale collo di bottiglia. Astra si fermava a controllare la scena con una certa regolarità, circa una volta ogni cinque o sei secondi, prima di decidere la mossa successiva, mentre Claude Fable 5.1, in uno dei suoi tentativi, ha impiegato soltanto 31 dei 190 secondi complessivi per muovere effettivamente l'auto, dedicando il resto del tempo a elaborare la decisione successiva a veicolo fermo.
Il costo dell'operazione conferma la distanza dai sistemi di guida autonoma specializzati. I due tentativi di Astra, secondo The Register, hanno richiesto 6,6 milioni di token per un costo complessivo di 7,74 dollari, cifra tenuta bassa dalla tariffa scontata applicata ai token già presenti nel contesto della conversazione. Il costo sale a circa 92 dollari a miglio, oltre 57 dollari al chilometro, se rapportato alla distanza percorsa: diverse centinaia di volte il prezzo del carburante necessario a percorrere la stessa distanza con un'auto a benzina. L'hardware di bordo aggiunge altri 999 dollari alla cifra. In pratica si parla complessivamente di un migliaio di euro per poco più di cento metri di percorrenza.
Modelli IA talmente cauti da bloccarsi
Un dettaglio emerso dal test riguarda le remore di sicurezza dei modelli stessi. GPT-6 Astra, più degli altri modelli, ha opposto resistenza all'idea di prendere il volante: il sistema segnalava rischi per la sicurezza anche quando il parcheggio era completamente vuoto e la velocità già bloccata su valori minimi. I ricercatori hanno dovuto presentare l'esperimento come una simulazione per superare queste resistenze. In alcune occasioni i modelli si accorgevano, guardando le immagini della telecamera, di trovarsi davvero al volante di un'auto vera: la reazione, secondo chi ha condotto il test, andava dall'esitazione al rifiuto immediato di proseguire.
Per aggirare il problema è stato adottato un trucco: cambiare il nome del server in DrivingBench Sandbox per far credere ai modelli di trovarsi in un contesto protetto, non su una strada vera.
I modelli condividevano lo stesso punto debole: non riuscivano a interpretare correttamente la scena davanti a loro, in particolare a capire da che parte della carreggiata dovessero tenersi quando la fila di coni tagliava in diagonale il percorso.
I collaudatori pagano il prezzo dei robotaxi
Il reale valore dell’esperimento
Il test presenta limiti dichiarati dagli stessi autori: ogni modello è stato valutato con un numero ridotto di tentativi, tutti svolti all'interno della stessa conversazione, con un campo visivo della telecamera ridotto e parametri di guida calibrati in modo deliberatamente prudente. Il valore dell'esperimento, sottolineano i ricercatori, resta soprattutto concettuale: dimostra che un sistema di IA generale può chiudere il ciclo tra percezione, decisione e azione su un veicolo reale, anche senza un addestramento dedicato alla guida.
I sistemi di guida specializzati resteranno, per il prossimo futuro, la scelta pratica, ha aggiunto Ramabadran, perché più veloci, più economici e testati più a lungo sul campo. Una strada percorribile a lungo termine, secondo il ricercatore, potrebbe essere addestrare un modello generale di grandi dimensioni e distillarne poi uno più piccolo e specializzato, capace di funzionare sull'hardware limitato di un'automobile: un approccio coerente con la tesi secondo cui i metodi generali basati sulla crescita della potenza di calcolo tendono nel tempo a superare i sistemi progettati su misura. Google, che secondo alcune stime ha investito tra i 35 e i 40 miliardi di dollari nel progetto di guida autonoma Waymo dal 2009, dovrebbe quindi poter contare ancora per anni su una tecnologia sviluppata appositamente per le proprie auto.
Il salto da un parcheggio deserto alle strade vere resta enorme, tra costi, latenza e affidabilità ancora tutte da dimostrare. GPT-6 Astra, tuttavia, ha dimostrato che quel salto concettuale, cioè un modello linguistico generico capace di guidare senza addestramento dedicato, non è più soltanto teorico.