L’acronimo - Devil– può sembrare inquietante. Ma il Differential Expression with Variational Inference Learning, è in realtà un algoritmo destinatoa cambiare il sequenziamento genetico.Perché è capace di analizzare dieci milioni di cellule in meno di due ore, con una velocità fino a quaranta volte superiore rispetto ai metodi più diffusi e un consumo di memoria circa tre volte inferiore.
Capire quali geni sono attivi nelle cellule è una delle chiavi per comprendere le malattie e sviluppare nuove terapie. Ma con le tecnologie di sequenziamento più avanzate, che oggi permettono di misurare l'attività genica in milioni di cellule da decine o centinaia di pazienti contemporaneamente, i dati prodotti sono diventati così abbondanti da mettere in crisi gli strumenti di analisi esistenti. Un gruppo di ricercatori dell'Università di Trieste, di Area Science Park, della Sissa e dello Human Technopole ha risposto a questa sfida, pubblicando i risultati su Nature Communications.
Il problema delle cellule che si somigliano troppo
Quando si vuole capire se un gene è più o meno attivo in cellule malate rispetto a cellule sane — un'analisi che tecnicamente si chiama differential expression — i metodi statistici classici presuppongono che ogni campione analizzato sia indipendente dagli altri. Questa assunzione reggeva bene quando si lavorava con il cosiddetto bulk sequencing, dove ogni campione corrispondeva a un paziente distinto. Con l'avvento del sequenziamento a singola cellula (single-cell RNA sequencing, o scRNA-seq), le cose si sono complicate. Le migliaia di cellule prelevate dallo stesso paziente non sono osservazioni indipendenti: condividono la stessa biologia individuale, lo stesso microambiente, le stesse caratteristiche genetiche di fondo. Ignorare questa struttura gerarchica — come fanno molti degli strumenti attualmente in uso — può portare a conclusioni distorte: le cellule dello stesso paziente si somigliano troppo tra loro, quindi trattarle come se fossero tante osservazioni indipendenti gonfia artificialmente la significatività statistica. E quando si confrontano più pazienti tra loro, le differenze tra individui rischiano di mascherare i segnali biologici reali che si sta cercando di individuare.
“La differential expression è una tecnologia matura”, spiega Giulio Caravagna dell'Università di Trieste, tra i principali autori dello studio. “Tuttavia, il passaggio al single-cell ha introdotto problemi statistici e computazionali che rendono complessa l'analisi integrata di grandi coorti di pazienti. Il nostro lavoro nasce proprio per risolvere questo collo di bottiglia, combinando innovazione metodologica e calcolo ad alte prestazioni per scalare alla possibilità di analizzare milioni di cellule da centinaia di pazienti”.
Come funziona Devil
Il vantaggio di Devil sta nel modo in cui tratta i dati. Non solo riconosce che le vere unità di confronto sono i pazienti, non le singole cellule, ma lo fa con grandissima velocità. Analizzare un milione di cellule richiede a Devil circa 22 secondi; lo strumento più rapido tra quelli attualmente disponibili ne impiega quasi 650, il secondo quasi 3000. Con dataset ancora più grandi il vantaggio si amplifica ulteriormente, fino a raggiungere una velocità quaranta volte superiore. Tutto questo consumando anche molta meno memoria.
E infatti, questo lavoro non sarebbe stato possibile senza Orfeo, il data center di Area Science Park, recentemente potenziato grazie ai fondi del Pnrr, come sottolinea Stefano Cozzini, direttore dell'Istituto Ricerca e Innovazione Tecnologica di Area. “La disponibilità di Gpu di ultima generazione, insieme a un'attenta ottimizzazione degli algoritmi su questa architettura, permette ora di usare Devil per affrontare problemi su una scala significativamente più ampia”.
Oltre alla velocità, Devil consuma molta meno memoria rispetto ai concorrenti. Non è un dettaglio secondario: significa che analisi prima riservate ai grandi centri di supercalcolo diventano accessibili a laboratori e ospedali con infrastrutture più modeste.
I test su dati reali: muscolo e sistema immunitario
Lo strumento è stato validato su due casi biologici concreti. Il primo riguarda l'identificazione delle cellule del sistema immunitario, dove Devil si è dimostrato più preciso e specifico nel riconoscere le popolazioni cellulari corrette rispetto ai metodi di confronto. Il secondo caso ha riguardato l'invecchiamento del tessuto muscolare umano: analizzando i dati di sequenziamento di nuclei di muscolo scheletrico da diciannove individui di età diverse, Devil ha individuato i cambiamenti nell'espressione genica legati all'età, riducendo il rumore e mettendo in evidenza ciò che le analisi alternative avevano in parte mancato o contaminato con segnali non pertinenti al tessuto muscolare.
Software libero per la comunità scientifica
Devil è disponibile come software open source, scaricabile gratuitamente da laboratori e ospedali di tutto il mondo. L'obiettivo dichiarato è abbassare la soglia di accesso a questo tipo di analisi, aprendo la strada a una nuova generazione di studi genomici su larga scala applicabili alla ricerca sui tumori, sulle malattie neurodegenerative e allo sviluppo della medicina personalizzata.
“Nello sviluppo di Devil, la sinergia di strumenti statistici classici e bayesiani rappresenta un fiore all'occhiello nel panorama della letteratura oncologica”, sottolinea Leonardo Egidi dell'Università di Trieste. Sviluppi futuri potrebbero coinvolgere modelli spazio-temporali per più pazienti: un bel mix di competenze statistiche, informatiche e biologiche.
Lo studio è stato sostenuto dalla Fondazione Airc per la ricerca sul cancro e dal Ministero dell'Università e della Ricerca nell'ambito del Piano Nazionale di Ripresa e Resilienza finanziato dall'Unione Europea - NextGenerationEU.