IL VOSTRO PACCHETTO di patatine potrebbe presto diventare una spia. No, non è l’ultima trovata di un agente segreto, né della Nsa. Ma il risultato di esperimenti condotti al Massachusetts Institute of Technology dove dei ricercatori hanno perfezionato un nuovo algoritmo capace, stavolta, di ricostruire i suoni e persino delle conversazioni comprensibili, analizzando le vibrazioni degli oggetti vicine alla fonte sonora.
Come? Filmandoli. “Quando un rumore urta qualcosa, gli fa emettere delle onde”, spiega nel comunicato del Mit Abe Davis, laureato in ingegneria elettronica e informatica all’università creata a Boston da Barton Rogers nonché coordinatore dello studio che coinvolge anche Microsoft e Adobe. “Un movimento che, a sua volta, produce un sottile segnale visuale, di solito invisibile a occhio nudo”. Si tratta, infatti, di spostamenti molto piccoli che sullo schermo si trasformano in figure da poche centinaia di pixel.
[[ge:rep-locali:repubblica:93310387]]
Perciò la nuova scoperta affonda le sue radici in un precedente lavoro condotto da Michael Rubinstein, ora ricercatore nel New England per conto di Microsoft. È il 2012, quando Rubinstein perfeziona una tecnica in grado di amplificare le minuscole variazioni visibili sullo schermo e rendere così facilmente riconoscibili dei movimenti prima impossibili da individuare. Come il respiro di un bimbo nel reparto neonatale di un ospedale o le pulsazioni di una persona. Il tutto attraverso una serie di filtri per immagini usati per misurare le fluttuazioni: il cambiamento dei colori ai confini, ad esempio, o i diversi orientamenti - orizzontale, verticale e diagonale - più le diverse scale.
“Gli studiosi”, si legge nel rapporto, “hanno elaborato un algoritmo che combina l’output di questi filtri per catturare gli spostamenti di un oggetto quando è colpito dalle onde del suono”. Mentre l’analisi dei filmati sarebbe consentita da una sua variazione. L’hanno ottenuta sfruttando un bug noto nel mondo della fotografia. Si chiama “rolling shutter” e si verifica nel momento in cui il soggetto di uno scatto si muove troppo velocemente all’interno dell’inquadratura. Fino a comparire distorto, a causa della velocità di scansionamento del sensore che registra una linea alla volta, dall’alto verso il basso. Una pecca preziosa per Davis e colleghi. Che spiegano: “Lievi deformazioni sui bordi delle cose nei video convenzionali, anche se invisibili a occhio nudo, contengono informazioni riguardanti le loro vibrazioni ad alta frequenza. Delle notizie sufficienti a produrre un segnale audio oscuro, ma potenzialmente utile”.
I risultati sono sorprendenti. In una dimostrazione, gli studiosi hanno ripreso un pacco di patatine distante circa 4 metri attraverso un vetro a prova di rumori. Mentre nella stessa stanza qualcuno cantava “Mary ha una pecorella”. I suoni ricostruiti usando le immagini non sono stati molto chiari, ma è stato comunque possibile decifrare le parole dette.
Certo, per riuscire nell’impresa è necessario che durante il video il numero dei frame catturati al secondo sia superiore alla frequenza del segnale audio. E in molti esperimenti i ricercatori del Mit hanno raggiunto il loro obiettivo grazie a telecamere ad alta velocità che registrano dai 2 ai 6 mila frame al secondo. Tuttavia, in altri hanno usato camere digitali standard, con una velocità di registrazione pari a 60 frame al secondo. Come quella dei nostri smartphone. L’audio ricavato è stato nel complesso meno fedele, però buono abbastanza per identificare il sesso, il numero di coloro che parlavano, e addirittura la qualità della loro voce fino a permetterne il riconoscimento.
Insomma, si aprono ora nuova scenari per i metodi usati dalle spie o dalla polizia nelle intercettazioni ambientali e anche per quello che Davis ha descritto come un nuovo tipo di “rispecchiamento”. “Ci stiamo occupando di ricostruire il suono grazie agli oggetti”, puntualizza, “e ciò ci permette di avere un sacco di informazioni sulle conversazioni che stanno avvenendo vicino alla cosa filmata. Ma anche sull’oggetto stesso dato che prodotti diversi rispondono al suono in maniera diversa”.
Come? Filmandoli. “Quando un rumore urta qualcosa, gli fa emettere delle onde”, spiega nel comunicato del Mit Abe Davis, laureato in ingegneria elettronica e informatica all’università creata a Boston da Barton Rogers nonché coordinatore dello studio che coinvolge anche Microsoft e Adobe. “Un movimento che, a sua volta, produce un sottile segnale visuale, di solito invisibile a occhio nudo”. Si tratta, infatti, di spostamenti molto piccoli che sullo schermo si trasformano in figure da poche centinaia di pixel.
[[ge:rep-locali:repubblica:93310387]]
Perciò la nuova scoperta affonda le sue radici in un precedente lavoro condotto da Michael Rubinstein, ora ricercatore nel New England per conto di Microsoft. È il 2012, quando Rubinstein perfeziona una tecnica in grado di amplificare le minuscole variazioni visibili sullo schermo e rendere così facilmente riconoscibili dei movimenti prima impossibili da individuare. Come il respiro di un bimbo nel reparto neonatale di un ospedale o le pulsazioni di una persona. Il tutto attraverso una serie di filtri per immagini usati per misurare le fluttuazioni: il cambiamento dei colori ai confini, ad esempio, o i diversi orientamenti - orizzontale, verticale e diagonale - più le diverse scale.
“Gli studiosi”, si legge nel rapporto, “hanno elaborato un algoritmo che combina l’output di questi filtri per catturare gli spostamenti di un oggetto quando è colpito dalle onde del suono”. Mentre l’analisi dei filmati sarebbe consentita da una sua variazione. L’hanno ottenuta sfruttando un bug noto nel mondo della fotografia. Si chiama “rolling shutter” e si verifica nel momento in cui il soggetto di uno scatto si muove troppo velocemente all’interno dell’inquadratura. Fino a comparire distorto, a causa della velocità di scansionamento del sensore che registra una linea alla volta, dall’alto verso il basso. Una pecca preziosa per Davis e colleghi. Che spiegano: “Lievi deformazioni sui bordi delle cose nei video convenzionali, anche se invisibili a occhio nudo, contengono informazioni riguardanti le loro vibrazioni ad alta frequenza. Delle notizie sufficienti a produrre un segnale audio oscuro, ma potenzialmente utile”.
I risultati sono sorprendenti. In una dimostrazione, gli studiosi hanno ripreso un pacco di patatine distante circa 4 metri attraverso un vetro a prova di rumori. Mentre nella stessa stanza qualcuno cantava “Mary ha una pecorella”. I suoni ricostruiti usando le immagini non sono stati molto chiari, ma è stato comunque possibile decifrare le parole dette.
Certo, per riuscire nell’impresa è necessario che durante il video il numero dei frame catturati al secondo sia superiore alla frequenza del segnale audio. E in molti esperimenti i ricercatori del Mit hanno raggiunto il loro obiettivo grazie a telecamere ad alta velocità che registrano dai 2 ai 6 mila frame al secondo. Tuttavia, in altri hanno usato camere digitali standard, con una velocità di registrazione pari a 60 frame al secondo. Come quella dei nostri smartphone. L’audio ricavato è stato nel complesso meno fedele, però buono abbastanza per identificare il sesso, il numero di coloro che parlavano, e addirittura la qualità della loro voce fino a permetterne il riconoscimento.
Insomma, si aprono ora nuova scenari per i metodi usati dalle spie o dalla polizia nelle intercettazioni ambientali e anche per quello che Davis ha descritto come un nuovo tipo di “rispecchiamento”. “Ci stiamo occupando di ricostruire il suono grazie agli oggetti”, puntualizza, “e ciò ci permette di avere un sacco di informazioni sulle conversazioni che stanno avvenendo vicino alla cosa filmata. Ma anche sull’oggetto stesso dato che prodotti diversi rispondono al suono in maniera diversa”.