Italian Tech

Storie

Davide Locatelli, 23 anni: destinazione San Francisco, per scommettere sui World Models

Davide Locatelli, 23 anni: destinazione San Francisco, per scommettere sui World Models

Laureato in ingegneria informatica al Politecnico di Milano, aveva un blog e una regola ferrea: tutto quello che impari, lo scrivi. Quel metodo, ancora prima della laurea, lo ha portato in Reactor: startup pioniera dei World Models, la tecnologia su cui Google DeepMind e Tesla stanno scommettendo per il futuro dell'IA interattiva. "Un anno fa non ne parlava nessuno. Noi eravamo già pronti"

5 minuti di lettura

Davide Locatelli ha 23 anni, viene da Bergamo. È in un piccolo ufficio di una stanza, a San Francisco, a sperimentare su una tecnologia di cui non parla quasi nessuno. Sa solo che il problema davanti a lui è concreto, e che una guida su come risolverlo non esiste ancora. Quindi si siede, ragiona, e poi, come ha sempre fatto, scrive.

La costante è sempre la stessa: scrivere. Per disciplina. Per lasciare traccia. Si era dato una regola semplice: ogni progetto che costruisci lo documenti. Anche se lo lasci a metà. "Così anche i progetti abbandonati diventavano qualcosa", racconta. Una regola che suona quasi banale, e che invece si è rivelata la mossa più decisiva della sua carriera. "Non sono stato uno studente modello. Ho preso 98 su 110 perché passavo il tempo a fare progetti sperimentali".

È stato proprio un blogpost — un esperimento personale su un World Model open source, allenato su un nuovo dataset, pagato di tasca propria — a far finire il suo nome nel radar di Alberto Taiuti e Bryce Schmidtchen, i fondatori di Reactor, la startup americana che sta costruendo l'infrastruttura per i World Models. Lo hanno chiamato. Gli hanno chiesto di costruire con loro. Ancora prima della laurea.

Daivde Locatelli, a destra, con Alberto Taiuti e Bryce Schmidtchen, i fondatori di Reactor
Daivde Locatelli, a destra, con Alberto Taiuti e Bryce Schmidtchen, i fondatori di Reactor 

"I World Models imparano come impariamo noi"

"Partiamo da quello che conosciamo già. ChatGPT legge una domanda e restituisce testo. Midjourney legge una descrizione e restituisce un'immagine. I modelli video di ultima generazione — Sora, Runway, Kling — leggono un prompt e restituiscono un filmato. In tutti questi casi la logica è la stessa: tu dai un input, il sistema elabora, ti restituisce un output. Finito. La sessione si chiude", spiega Davide.

I World Models rompono questa logica alla radice. "Sono modelli di IA che imparano come impariamo noi. Osservando la realtà. E poi la sanno ricreare". La differenza cruciale non è nella qualità della ricostruzione, è in quello che succede dopo. Un World Model non ti restituisce un video da guardare. Ti restituisce un ambiente in cui entrare. Un ambiente che osserva quello che fai e reagisce in tempo reale. "Immagina di non guardare più un filmato generato dall'IA, ma di muoverti dentro di esso. Di girare a destra e vedere cosa c'è dietro l'angolo. Di toccare un oggetto e vederlo cadere. Di cambiare la luce, il meteo, la fisica della scena — non in post produzione, ma mentre accade. Il modello non ha pre-renderizzato niente: sta generando il mondo attorno a te, frame per frame, mentre tu ci sei dentro. È la stessa differenza che c'è tra guardare una fotografia di un posto e camminarci dentro".

Ogni frame deve arrivare in meno di 50 millisecondi, la soglia fisica sotto cui il cervello umano percepisce continuità. Sopra quella soglia, l'ambiente si spezza, l'illusione collassa. Nessuna infrastruttura esistente era costruita per questo.

"Ho dovuto capire tutto da zero"

"L'ho trovato per caso. Un paper su uno dei primissimi World Model, al tempo era ancora una nicchia piccolissima, poche persone ci sperimentavano. Mi ha incuriosito, e ho fatto quello che faccio sempre: ho preso il modello open source, l'ho fatto mio. L'ho allenato su un nuovo dataset e ho scritto un blogpost su come avevo fatto. Era una sfida verso me stesso. Il compute (la potenza di calcolo a noleggio) me lo sono pagato di tasca mia. Non esisteva nessuna guida, ho dovuto capire tutto da zero".

Il risultato è un sistema che genera in tempo reale ambienti di gioco interattivi: il mondo di Mario Kart non pre-renderizzato, ma immaginato frame per frame dal modello, mentre il giocatore si muove. Un esperimento. Un blogpost. Niente di più. O almeno, così sembrava. Quel blogpost è diventato un riferimento per altri ricercatori. "Non avevo previsto niente di tutto questo. Per me era solo un modo per documentare quello che avevo imparato, come faccio con tutto. Ogni progetto sul blog. Anche quelli abbandonati. Non li perdevo. Diventavano qualcosa".

Sono stati Alberto Taiuti e Bryce Schmidtchen a trovarlo. Taiuti — italiano, ex Apple Vision Pro, cofondatore e CTO di Luma AI — e Schmidtchen — anche lui ex Apple Vision Pro, anni di lavoro su computer vision per AR/VR — avevano in testa una domanda precisa: se i World Models fossero esplosi, chi avrebbe costruito l'infrastruttura per farli girare davvero? Nessuno, ancora. Hanno trovato il blogpost, hanno chiamato Davide, e gli hanno chiesto di costruire con loro le basi di Reactor. Ancora prima che si laureasse.

La collaborazione è iniziata a distanza. "Per alcuni mesi abbiamo sperimentato e capito che il grande problema sarebbe stato l'infrastruttura attorno ai World Models". Poi Davide è partito: per qualche mese a San Francisco, in quel piccolo ufficio di una stanza, insieme ai due fondatori. In tre, hanno continuato a costruire le fondamenta di Reactor, e in quei mesi hanno chiuso il seed round da 10 milioni di dollari. Poi è tornato in Italia, dove ha continuato a lavorare da remoto.

"Il grande problema era l'infrastruttura"

Una scommessa fatta in anticipo, su qualcosa che il resto del settore non aveva ancora visto. Un anno dopo è l'argomento più discusso dell'industria. Y Combinator consiglia esplicitamente alle startup di lavorarci. Davide era già lì.

"Quando ero a San Francisco l'anno scorso, l'azienda era in stealth [segreta ndr.] e nessuno sapeva cosa fossero i World Models. San Francisco è una città in cui la prima domanda non è 'come stai?' ma 'cosa fai, a cosa lavori'. Girare con un'azienda stealth, non poter dire nulla, dover restare sul vago, era frustrante. Adesso posso girare con il cappellino di Reactor e le persone mi riconoscono. Pensare che un anno fa eravamo in tre in una stanzetta".

Poi le cose sono cambiate. Reactor è uscito dalla modalità incognito, il settore ha scoperto i World Models, e il suo ruolo si è definito. "Mi occupo in prima persona delle tecnologie della piattaforma, delle sfide infrastrutturali portate dai World Models, e del framework che permette ai modelli di essere ospitati e distribuiti. Sono il punto di collegamento tra quello che i modelli sanno fare sulla carta e quello che uno sviluppatore riesce effettivamente a usare in produzione".

Reactor, il tocco umano è ancora tutto

Maggio 2026. Reactor esce dallo stealth con 59 milioni di dollari, un round guidato da Lightspeed Venture Partners, che aveva già co-guidato il seed e ora raddoppia la scommessa. "I modelli video in tempo reale sono attualmente inaccessibili agli sviluppatori a causa della mancanza di infrastrutture in grado di servirli in modo affidabile", dice Bucky Moore, partner di Lightspeed. Reactor ha costruito quel layer, un SDK (Software Development Kit, ovvero kit di sviluppo software) e API unificati che permettono di creare applicazioni real-time interattive con poche righe di codice, mantenendo la latenza sotto i 50 millisecondi.

Ma il nome che cattura l'attenzione è quello di Jeffrey Katzenberg, il produttore che ha cofondato DreamWorks e guidato Disney e Paramount. Ha visto arrivare la CGI quando il cinema era ancora convinto che l'animazione tradizionale fosse eterna. Ora ha preso una quota in Reactor e siederà come board observer. "Sono certo che siamo sull'orlo di uno di quei momenti trasformativi. Il tocco umano è ancora tutto, per me". Non la retorica dell'IA che sostituisce gli artisti. Quella dell'IA come strumento nelle mani di chi sa usarlo. Tra i partner c'è anche Amazon Web Services. Un dettaglio che racconta meglio di tutti cosa sa fare la piattaforma: durante una call Zoom con un dirigente AWS, Taiuti ha aperto Reactor e — in tempo reale, senza interruzioni — ha trasformato il volto del suo interlocutore in quello di Albert Einstein. Un World Model che riscrive il frame mentre la conversazione continua.

Davide Locatelli non è partito con un piano. Non ha aspettato la laurea, non ha fatto un MBA. Ha costruito cose concrete, le ha scritte, e ha lasciato che parlassero per lui. Ora sta completando la sua application per il visto O-1, quello riservato agli individui con abilità straordinarie. Nel suo caso le prove esistono tutte: un blogpost diventato riferimento per la ricerca internazionale, un ruolo fondativo in una startup, un'infrastruttura costruita da zero. A 23 anni. Da Bergamo a San Francisco. "Un anno fa non ne parlava quasi nessuno." Pausa. "Noi eravamo già pronti.”