L'intelligenza artificiale tenta la profezia: prevede il futuro da una foto
di EMILIO VITALIANO
Dai ricercatori del MIT un algoritmo che da un'immagine di base realizza un video con una previsione di ciò che può avvenire in quello che vede nell'ambiente
Aggiornato alle 2 minuti di lettura
IMMAGINATE di bloccare un avvenimento in un determinato istante e di fantasticare su quali possano essere gli sviluppi della situazione interrotta. Qualche volta potrebbe essere un compito facile, altre un po' meno, ma gli esseri umani sono comunque dotati di capacità intuitive che consentono loro di effettuare delle previsioni. Più complicato è per le macchine, anche se i ricercatori del Massachusetts Institute of Technology (MIT) si stanno impegnando per colmare questo gap finora abissale. Perché un nuovo studio ha sviluppato un sistema di intelligenza artificiale (AI) in grado di realizzare proprio delle previsioni su come una determinata scena potrebbe trasformarsi e costruirne un esempio di svolgimento.
L'algoritmo creato, infatti, partendo da un fermo immagine, ha la capacità di generare un mini video che mostra nel concreto quali potrebbero essere le evoluzioni di un contesto in relazione alle condizioni al contorno. Le possibilità sono molteplici e sottolineano un aspetto che forse per tutti noi può essere banale, ma che non lo è per un software. Se qualcuno sta cucinando, per esempio, lo sviluppo successivo e più naturale potrebbe essere il consumo del cibo appena preparato. Eppure anche una previsione così semplice è un passo ancora abbastanza difficoltoso per l'intelligenza artificiale e presume la necessità innanzitutto di capire quello che sta avvenendo nel presente.
I software che tentano di prevedere il futuro
Predire il futuro è uno dei desideri tipici dell’essere umano. Negli anni numerosi software sviluppati da ricercatori ambiziosi hanno cercato di effettuare previsioni in settori ben precisi. Per questo motivo, lo studio del MIT che vuole un’intelligenza artificiale in grado di costruire dei video capaci di immaginare possibili scenari futuri, è solo un passo avanti di un cammino che è stato già tracciato più volte, anche se con sfumature molto diverse.
In ogni caso, per sviluppare il software, i ricercatori hanno utilizzato come base due milioni di video che riproducevano diverse situazioni. In seguito hanno fornito un'immagine per creare un filmato con dei possibili scenari futuri relativi proprio alla foto di partenza. Per migliorare la loro qualità è stata utilizzata una configurazione conosciuta come "generative adversarial network" (GAN), un metodo che prevede la realizzazione di un video da parte di un network che poi viene giudicato da un suo simile per comprendere se il filmato è reale o creato da una macchina. Così facendo, i due network sono in competizione reciproca ed affinano le loro capacità per prevalere uno sull'altro, con la conseguenza che i video appaiono sempre più realistici. Ovviamente entro certo limiti, perché il sistema sta muovendo solo i suoi primi passi ed i microfilm sono ancora abbastanza approssimativi; infatti, al momento contengono appena trentadue fotogrammi (per la durata di circa un secondo) e sono in bassa risoluzione.
Inoltre, al software manca quella sorta di buon senso necessario per capire azioni scontate per gli esseri umani (per esempio, un treno in partenza da una stazione deve lasciare la stazione stessa). Un problema legato alla scarsa conoscenza del mondo, che attualmente è costruita solo sui due milioni di video impiegati come base. A tal proposito è interessate sottolineare come i filmati di apprendimento non siano stati etichettati, in quanto il nuovo sistema è in grado di acquisire conoscenza senza supervisione, con un notevole risparmio di tempo.
Per ora comunque l'aspetto più interessante del software è la dimostrazione di quello che in potenza sarà in grado di fare nel futuro. Un sistema con capacità predittive (anche minime) e consapevole della realtà che lo circonda, infatti, ha riscontri nel concreto ed in vari ambiti, poiché qualsiasi robot che opera interagendo con l'uomo deve essere dotato di tali caratteristiche. Un esempio semplice e chiarificatore di questo concetto è fornito proprio da Carl Vondrick, membro del team padre di questa ricerca: se una persona sta per sedersi di sicuro non gradisce che un robot sposti la sedia. In conclusione, il prossimo passo sarà rendere i video più lunghi e, anche se il futuro non potrà mai essere previsto con esattezza, un giorno il sistema sviluppato dal MIT offrirà ai suoi utenti più scenari alternativi di potenziali evoluzioni. Insomma, un modo per ricordarci quante sono le biforcazioni che in ogni momento la vita di tutti noi può imboccare.