Microsoft annuncia i suoi primi modelli IA fatti in casa: MAI-Voice-1 e MAI-1-preview
di Bruno RuffilliIl primo è un modello vocale all’avanguardia, il secondo punta a compete con i grandi modelli fondazionali per l’elaborazione del linguaggio. Così l’azienda di Satya Nadella si prepara a un futuro oltre OpenAI
Fino a ieri, l’intelligenza artificiale di Microsoft parlava con la voce e il cervello di OpenAI. Da oggi, però, l’azienda di Satya Nadella compie un passo verso l’autonomia: lancia due modelli sviluppati interamente in casa, che segnano l’inizio di una nuova fase nella sua strategia AI. Si chiamano MAI-1-preview e MAI-Voice-1, e rappresentano due direzioni distinte ma complementari. Il primo punta a competere con i grandi modelli fondazionali per l’elaborazione del linguaggio, il secondo è un modello vocale all’avanguardia, ottimizzato per la sintesi audio rapida, realistica ed espressiva.
Parole parole parole, soltanto parole
MAI-Voice-1 è un modello text-to-speech progettato per generare voce sintetica in maniera estremamente rapida, efficiente e naturale. Secondo Microsoft, è in grado di generare un minuto di audio in meno di un secondo, utilizzando una sola GPU. Il bassissimo costo computazionale lo rende ideale per applicazioni consumer e scalabili su larga scala.
L’obiettivo, chiarito anche nel blog ufficiale, è far sì che l’intelligenza artificiale non solo risponda, ma conversi, con intonazione, enfasi, pause e ritmo simili a quelli di un essere umano, perché l’azienda di Redmond ritiene che la voce sarà la principale interfaccia del futuro. Non per niente ha lanciato da poco Copilot Daily, una nuova funzionalità che presenta le notizie quotidiane in formato audio, lette da un conduttore virtuale. A questo si aggiungono progetti come Copilot Labs, dove l’utente può generare racconti, storie per bambini, meditazioni guidate, scegliendo toni e stili diversi.
Già con Azure Cognitive Services, Microsoft aveva mostrato capacità vocali avanzate, ma il salto di qualità è notevole. L’attenzione alla “personalizzazione narrativa” suggerisce che l’azienda stia cercando di differenziare le proprie AI da quelle di Google o OpenAI, puntando sull’empatia vocale e sull’integrazione con la vita quotidiana.
MAI-1-preview: meno chip, più intelligenza
Se MAI-Voice-1 dà una voce all’AI, MAI-1-preview punta a darle un pensiero autonomo. È un modello linguistico di grandi dimensioni (LLM) addestrato interamente da Microsoft su circa 15.000 GPU Nvidia H100, un numero considerevole ma molto più basso rispetto a concorrenti come Grok di xAI, che ne ha utilizzato oltre 100.000. L’approccio dell’azienda punta a un addestramento efficiente e ottimizzato, riducendo i costi computazionali e valorizzando dati di qualità.
Il modello, ancora in fase sperimentale, è stato messo alla prova pubblicamente su LMArena, una piattaforma comunitaria di benchmark in cui ricercatori e sviluppatori possono confrontare le prestazioni dei vari modelli in compiti come la comprensione, la generazione di codice, la logica e la conversazione. MAI-1-preview non è ancora all’altezza di GPT-4 o Claude 3 Opus, ma mostra ha prestazioni promettenti soprattutto nei compiti di istruzione e comprensione generalista. La fase di test continuerà nei prossimi mesi, e Microsoft ha già avviato collaborazioni con gruppi selezionati di utenti per verificarne l’affidabilità e l’applicabilità in scenari reali.
MAI-1 non è un “modello monolitico e onnisciente”, ma piuttosto un sistema modulare di agenti AI, ognuno specializzato in compiti specifici. È il primo mattone di un ecosistema più ampio, dove diversi modelli collaborano, si scambiano informazioni e forniscono risposte più puntuali, affidabili e personalizzate.
Oltre OpenAI
Dopo aver investito oltre 13 miliardi di dollari in OpenAI, e averne integrato i modelli in praticamente tutti i suoi prodotti, da Word a GitHub, ora Microsoft si muove per affrancarsi almeno in parte da questa dipendenza. Mustafa Suleyman, che ha lasciato Google DeepMind per fondare Inflection e poi passare a Microsoft, ha spiegato che ogni azienda che voglia essere rilevante nell’intelligenza artificiale deve sviluppare modelli propri. Il motivo non è solo tecnico, ma anche politico, economico e culturale: chi controlla i modelli, controlla l’evoluzione del software, del cloud e delle interfacce utente.
Altri giganti come Amazon e Apple stanno accelerando su modelli interni. Apple ha iniziato a integrare Apple Intelligence nei propri dispositivi, Amazon ha acquisito startup come Anthropic per potenziare Alexa. Microsoft, però, ha il vantaggio dell’infrastruttura: possiede Azure, uno dei più grandi cloud al mondo, e può permettersi di sperimentare su scala.
Non è detto che MAI-1 o MAI-Voice-1 sostituiranno a breve GPT-5, ma il loro significato va oltre le prestazioni immediate. Rappresentano un cambiamento di passo. Microsoft non si limita più a integrare AI: la costruisce. E così manda un messaggio chiaro al mercato, e forse anche a OpenAI.