Un italiano ha reso più efficienti i data center Amazon, superando un problema aperto dagli anni ’80
di Pier Luigi PisaL’informatico Giacomo Bernardi ha contribuito a ripensare la rete dei data center Amazon Web Services, la divisione cloud di Amazon, applicando su larga scala la teoria dei grafi casuali, un’idea studiata da decenni e a lungo difficile da usare in produzione. In questa intervista ci spiega come ci è riuscito e quali vantaggi ha portato ad AWS, in una fase in cui le Big Tech investono miliardi nelle infrastrutture per l’IA
In un'epoca in cui l'intelligenza artificiale divora capitali e watt a ritmi senza precedenti, e i giganti del cloud sono impegnati in investimenti miliardari per costruire infrastrutture sempre più potenti, un informatico italiano ha trovato il modo di rendere i data center di Amazon Web Services - uno degli asset strategici più preziosi di Amazon - meno costosi e meno energivori. Senza sacrificare le prestazioni.
Si chiama Giacomo Bernardi, ha 44 anni ed è uno dei tre scienziati che hanno risolto un problema inseguito per decenni dall'intera industria dei data center: applicare la teoria dei grafi casuali alle reti su larga scala.
L'intuizione, maturata nel 2023 ispirandosi alle tassellature di Penrose - un particolare schema geometrico scoperto nel 1974 dal matematico e fisico Roger Penrose - è diventata in tre anni l'architettura di rete predefinita per i nuovi data center Amazon nel mondo.
Oggi la nuova architettura RNG [Resilient Network Graph] viene presentata ufficialmente attraverso la pubblicazione di un paper scientifico.
Ma non si tratta di un’idea solo sulla carta: AWS ha già costruito data center in Spagna e Germania seguendo le istruzioni di Bernardi.
Quando intuiamo il valore del lavoro di ricerca di Bernardi, non riusciamo a trattenere una battuta: “Giacomo, quand’è che Amazon la nominerà vicepresident?” [si tratta di una delle cariche più alte a cui si può aspirare nelle big tech americane].“Spero presto, ma ne dubito fortemente!”, risponde Bernardi sorridendo e stando al gioco, in collegamento dalla sua casa di Bologna. Le cuffie nere gli coprono le orecchie. Sembra un gamer.
“In realtà l'infrastruttura di Amazon si basa su tantissime iniziative di efficientamento diverse - prosegue, con discreta umiltà -. Lavoriamo costantemente anche per ottimizzare i chip e i router, che sono tutti progettati in casa. Il vero vantaggio competitivo sta nel fatto che quasi la totalità dell'infrastruttura che utilizziamo è interamente disegnata da AWS”.
Qual è il ruolo che ricopre, attualmente, in AWS?
“Come Principal Applied Scientist ricopro un ruolo un po' atipico, perché fa da ponte tra l'ingegneria di rete pura – intesa come costruzione di un'infrastruttura che viene poi replicata nei data center globali – e la ricerca. In Amazon c'è una cultura fortemente basata sull'assunzione di rischi e sulle scommesse, sia a livello aziendale che personale. Raramente la leadership impone dall'alto i temi su cui lavorare. È molto più probabile che siano gli ingegneri che operano alla base dell'organizzazione, vivendo da vicino le sfide di scalabilità, a lanciare nuove idee. È proprio in questo contesto che, nel 2023, mi sono appassionato al progetto di riorganizzare in modo diverso i router all'interno dei data center”.
Partiamo dalle basi. Come vengono organizzati tradizionalmente i data center?
“Da decenni, virtualmente tutti i data center nel mondo, non solo quelli di Amazon, utilizzano la stessa tipologia di rete. Ci sono centinaia o decine di migliaia di server collegati a router strutturati in una rigida gerarchia ad albero, definita in inglese fat tree (albero grasso)”.
Quindi i server si trovano sulle "foglie" più basse e poi c'è un collegamento che sale verso l'apice. Come funziona esattamente?
Esatto, puoi immaginarla come una struttura a piramide. I router sono collegati in livelli successivi fino ad arrivare all'apice, mentre i server – i veri "clienti" di questa rete – sono connessi esclusivamente alla fascia più bassa. Per comunicare tra loro, i dati compiono un percorso risalendo la piramide per poi ridiscendere. È una topologia che ha sempre funzionato bene per la sua semplicità; essendo stata studiata approfonditamente per decenni, è molto prevedibile e sappiamo esattamente come si comporterà la rete in caso di guasti. Tuttavia, ha un enorme svantaggio: richiede la costruzione dell'intera piramide. Se vuoi aggiungere mille server alla base, devi necessariamente implementare anche nuovi router nella parte alta dell'albero per fornire loro connettività.
E questo, in un periodo storico in cui si punta alla massima potenza di calcolo, è un problema.
“Esatto. Questa piramide non può crescere all'infinito, altrimenti le performance e la latenza peggiorerebbero inevitabilmente. Il "sacro graal" nel mondo del networking è sempre stato quello di organizzare i router in una rete piatta, collegandoli tra loro senza livelli gerarchici superiori”.
Quindi in modo casuale.
“Sì. Matematicamente è noto che creando una magliatura casuale tra i router, la lunghezza media del percorso tra due dispositivi qualsiasi si accorcia, rendendo il sistema più efficiente. Per "casuale" intendo un approccio quasi letterale, come lanciare dei dadi: prendo il router numero 1 e decido di collegarlo al 3, al 7 e al 5. E ripeto il processo. Sulla carta è bellissimo e semplice”.Mi lasci indovinare: nella realtà non è così facile.“Realizzarlo in pratica su scala globale per tutti i data center di Amazon è un'altra storia. Subentrano complessi problemi fisici di cablaggio in fibra ottica, questioni di routing per decidere come far circolare le informazioni all'interno della magliatura, e sfide operative su come intervenire in caso di guasto”.
Dunque finora non c’era mai riuscito nessuno.
“No, si trattava di un'idea teorica di cui si discuteva già in alcuni articoli scientifici degli anni '80 e '90. I matematici ipotizzavano che collegando i router in maniera casuale si sarebbe potuta creare una rete piatta estremamente efficiente. Tuttavia, come spesso accade in ambito accademico, l'idea è rimasta solo sulla carta”.
Fino a quando lei non ha deciso di esplorarla.
“Sì. Inizialmente [era il 2023, nda] ho seguito un'idea alternativa, basata su un famoso concetto geometrico: la tassellatura di Penrose, formulata dal fisico e Premio Nobel Roger Penrose. Volevo modellare una rete piatta seguendo proprio quello schema. Sulla carta venivano fuori diagrammi affascinanti, ma, nonostante mesi di lavoro, non siamo mai riusciti a farla funzionare davvero bene”.
Qual era il problema principale di quell'approccio?
“La scalabilità. Al crescere della rete, le performance continuavano a peggiorare, che è poi lo scoglio contro cui si scontrano tutti i progetti di questo tipo. Tuttavia, quella ricerca ha avuto il grande merito di appassionare il mio collega Ratul Mahajan, un Amazon Scholar che lavora in azienda ed è anche professore all'Università di Washington. Abbiamo continuato a lavorarci e, durante i test, ci siamo resi conto che meno strutturavamo la rete, migliori erano i risultati. Abbiamo ripensato a quegli articoli accademici degli anni '80 e '90 e ci siamo detti che, forse, aggiungere vera casualità ai collegamenti era la strada giusta. Avviate le simulazioni, abbiamo notato performance ottime e una scalabilità perfetta, ma paradossalmente non ne capivamo il perché: non esisteva ancora un modello matematico in grado di descrivere le prestazioni di una rete casuale del genere”.
Qual è stato il momento di svolta?
“Abbiamo cercato in Amazon un esperto di teoria dei grafi e abbiamo trovato Seshadri Comandur, un altro Amazon Scholar e professore all'Università della California, Santa Cruz. Lui è un matematico specializzato proprio nella teoria dei grafi randomici. Quando ci siamo conosciuti, la prima cosa che ci ha detto è stata: "Guardate che io non so nemmeno cosa sia un data center". Ci siamo detti: "Bene, abbiamo un problema". Invece, grazie a Seshadri, siamo riusciti a creare il modello matematico che descrive le performance in base ai parametri di design della rete. Su questo abbiamo recentemente pubblicato un articolo scientifico che illustra il funzionamento della nostra architettura, chiamata RNG [Resilient Network Graph, nda]”.
Vi ha aiutato l'intelligenza artificiale nelle simulazioni?
“Da oltre un anno la quasi totalità del software per le simulazioni scientifiche che utilizzo è scritto dall'intelligenza artificiale. Nel caso di RNG, abbiamo consumato l'equivalente di 500 "anni-processore". È come se una singola CPU avesse eseguito simulazioni ininterrottamente per mezzo millennio; sfruttando la potenza del cloud abbiamo completato il lavoro in poche settimane. E l'aspetto più interessante è che ci siamo avvalsi della stessa identica infrastruttura accessibile a qualsiasi cliente AWS”.
Oggi l'IA permette di risolvere problemi aperti con grande rapidità. Seshadri, il matematico del vostro team, come ha vissuto l'impatto di questi strumenti sulla sua disciplina?
“Su quel fronte specifico l'intelligenza artificiale non è ancora arrivata. È stata la prima volta che ho visto lavorare un matematico puro così da vicino, ed è stato affascinante. Seshadri lavora rigorosamente con carta e penna. Si porta ovunque quaderni pieni di dimostrazioni, congetture e teorie matematiche complesse; una dimensione che, al momento, non è ancora stata toccata dall'AI. L'apporto dell'intelligenza artificiale rimane invece immenso e insostituibile nella stesura del codice di simulazione”.
Una volta intuito che la vostra teoria avrebbe funzionato, come siete riusciti a metterla in pratica?
“l problema è diventato la costruzione fisica della rete. Immagina un data center con decine di migliaia di router da collegare in modo casuale: un vero e proprio mostro fatto di cavi in fibra ottica intrecciati. Nel 2024 abbiamo deciso di costruire comunque la prima rete RNG in un data center in Irlanda. Lo abbiamo fatto volutamente senza aver ancora risolto il problema pratico del cablaggio, pur sapendo che sarebbe stata un'impresa titanica, solo per confermare le performance sul campo. Le squadre locali hanno lavorato su tre turni per tutta l'estate per completare i collegamenti. Ovviamente, sapevamo che non era una strada percorribile su scala globale”.
Come avete risolto?
“All'inizio del 2025 abbiamo ideato e progettato un apparato che chiamiamo shufflebox. Si tratta di una scatola sigillata che racchiude al suo interno tutta la complessità della rete casuale. Fuori si presenta con un normale allineamento di porte in fibra. In questo modo, gli operatori non devono più preoccuparsi di gestire il groviglio di cavi”.
Questa soluzione innovativa è stata poi applicata in quel primo data center irlandese?
“No, e questo dimostra la filosofia di Amazon e la propensione al rischio di cui parlavamo. Abbiamo costruito l'intero data center irlandese "a mano", lo abbiamo utilizzato per mesi per erogare traffico reale ai clienti esterni, verificando che le prestazioni rispecchiassero le aspettative. Una volta ottenuta la conferma, nonostante l'enorme investimento economico iniziale, lo abbiamo smontato completamente. Sulla base di quella lezione, nel corso del 2025 abbiamo costruito tre nuovi data center in Europa, in Spagna e in Germania, basati fin dalla nascita sulle shufflebox”.
E attualmente funzionano tutti a pieno regime?
“Sì, sono tutti in produzione e servono quotidianamente i clienti”.
Dal punto di vista dell'efficienza energetica e dei costi, qual è il guadagno?
“La cosa affascinante è che le performance di rete sono letteralmente indistinguibili da quelle di un'infrastruttura tradizionale. Pur utilizzando il 69% in meno di router rispetto alla topologia ad albero, offriamo la stessa identica efficienza ai clienti. Questa riduzione dell'hardware si traduce in un abbattimento dei costi del 27%, un dato enorme se applicato alla scala globale di Amazon, e in un taglio del 40% dei consumi elettrici per il networking, con una conseguente e drastica riduzione delle emissioni di CO2”.
È previsto che anche i prossimi data center seguano questa struttura?
“Sì, già da qualche mese tutti i nuovi data center globali di AWS vengono costruiti basandosi su questa architettura infrastrutturale”.
Pensa che in futuro, così come siete riusciti a confinare la casualità in una scatola, i data center avranno dimensioni più contenute e non saranno enormi "cattedrali nel deserto"? Possiamo essere ottimisti?
“Assolutamente sì. Già oggi AWS pubblica i dati relativi all'efficienza energetica (il PUE, Power Usage Effectiveness, nda) e i risultati sono sensibilmente migliori rispetto alla media del settore. Iniziative come RNG ci permetteranno di ottimizzare ulteriormente questi consumi. L'elemento chiave, però, rimane il controllo totale dell'intera filiera produttiva. Dal chip della scheda di rete ai router, fino ai connettori e al software di routing: è tutto progettato in casa. Solo quando possiedi la conoscenza profonda di tutto lo stack tecnologico puoi fare un'innovazione così radicale. In aziende costrette a dipendere da tecnologie di terzi, un progetto del genere sarebbe stato pressoché impossibile”.
Lei crede che i data center un domani saranno davvero lanciati nello spazio o collocati negli oceani, come ipotizzano alcuni? È pura fantascienza o una prospettiva su cui puntare?
“Credo sia un tema di ricerca scientifica estremamente interessante, ma riguarda scenari decisamente a lunghissimo termine. È molto improbabile assistere ad applicazioni commerciali di questo tipo nel breve periodo”.
Oggi molti giovani informatici sono attratti dai modelli generativi, prestando forse meno attenzione alle reti, all'energia e ai sistemi distribuiti. Cosa direbbe a chi vuole contribuire allo sviluppo dell'IA partendo dall'infrastruttura?
“Direi che chi inizia a studiare informatica oggi si troverà di fronte a un settore che tra cinque, o magari solo tre anni, sarà già radicalmente cambiato. E questa è un'ottima notizia. Non può esistere intelligenza artificiale senza una solida infrastruttura alle spalle. Ciò che costruiamo oggi in AWS è totalmente diverso da ciò che si studiava fino a pochi anni fa. Lavorare "dietro le quinte" garantisce uno stimolo continuo e l'opportunità di confrontarsi con un ambiente in perenne trasformazione, persino per chi ha decenni di esperienza alle spalle”.