✕
Brewster Kahle, fondatore di Internet Archive, apre un container di stoccaggio a Richmond, California (Lianne Milton/ The New York Times) 

L'uomo che archivia internet

Nei computer di un’ex chiesa di San Francisco Brewster Kahle immagazzina tutte le pagine web del mondo. Mission impossible non innocua: chiedete a Trump e ai separatisti ucraini. Reportage
7 minuti di lettura
SAN FRANCISCO. L'aspettativa di vita di una pagina web è di cento giorni. Poco più di una stagione e poi rischi di non trovarla più, giura chi compila queste statistiche. Chi l'ha creata può averla cancellata o, più semplicemente, averle cambiato posto. Il risultato non cambia: Error 404, Page Not Found, che è il modo in cui il sito che avrebbe dovuto ospitarla si scusa per il disagio. Si diceva una volta: internet è per sempre, una volta che ci hai scritto qualcosa ci resta. Soprattutto certe figuracce epiche. In realtà dipende. Brewster Kahle, l'uomo con la prima camicia impossibile di questa storia (con mandala stilizzati verde bottiglia, verde salvia, nero e blu navy) che si è tolto le scarpe e siede davanti a me, è quello che da oltre vent'anni fa di tutto perché sia sempre scolpita nel marmo. Perché chi dimentica la storia è condannato a ripeterla. All'inizio il suo Int…
SAN FRANCISCO. L'aspettativa di vita di una pagina web è di cento giorni. Poco più di una stagione e poi rischi di non trovarla più, giura chi compila queste statistiche. Chi l'ha creata può averla cancellata o, più semplicemente, averle cambiato posto. Il risultato non cambia: Error 404, Page Not Found, che è il modo in cui il sito che avrebbe dovuto ospitarla si scusa per il disagio. Si diceva una volta: internet è per sempre, una volta che ci hai scritto qualcosa ci resta. Soprattutto certe figuracce epiche. In realtà dipende. Brewster Kahle, l'uomo con la prima camicia impossibile di questa storia (con mandala stilizzati verde bottiglia, verde salvia, nero e blu navy) che si è tolto le scarpe e siede davanti a me, è quello che da oltre vent'anni fa di tutto perché sia sempre scolpita nel marmo. Perché chi dimentica la storia è condannato a ripeterla. All'inizio il suo Internet Archive voleva archiviare solo il web, poi l'ambizione è decollata e oggi, candidamente, la missione è "fornire accesso universale a tutta la conoscenza".

Magniloquenza a parte, in pratica cosa significa? A ieri, ma sono numeri che crescono di giorno in giorno, parliamo di 330 miliardi di pagine web salvate, 20 milioni tra libri e testi vari, 4,5 milioni di audio (compresi 180 mila concerti dal vivo), 4 milioni di video (inclusi 1,6 milioni di programmi televisivi), 3 milioni di immagini, 300 mila programmi software. Tutta roba a cui si può aver accesso, gratuitamente, da ogni parte del mondo, registrandosi all'indirizzo archive.org. In confronto la mitica biblioteca del Congresso di Washington, almeno dal punto di vista del prestito digitale, fa la figura di una micragnosa emeroteca di quartiere. Newyorchese cinquantottenne, dopo la laurea in informatica al Mit, Kahle si inventa prima il Wais, un protocollo per pubblicare online, e poi Alexa (da Alessandria d'Egitto, in ossequio alla preesistente ossessione bibliofila), un software che in automatico valutava se un sito era attendibile, famoso e quanto. Vende Wais ad America Online per 15 milioni di dollari e Alexa ad Amazon - che poi mutuerà il nome per battezzare la sua intelligenza artificiale - per 250.

L'uno-due lo emancipa definitivamente dal bisogno che è ancora trentenne e a quel punto decide di sdebitarsi con la società. Come? Lavorando a correggere una distrazione di Tim Berners-Lee, il fisico del Cern che ha dato i natali al web, architettura straordinariamente elegante ma che non prevedeva di tener traccia delle varie versioni delle pagine pubblicate. Il nuovo cancellava il vecchio e tanti saluti. "Wikipedia, ad esempio, non si comporta così" dice nel suo ufficio di San Francisco a pretenziosità zero, così lontano dall'estetica finto-casuale ma ormai standard della vicina Silicon Valley, "e puoi sempre risalire alle versioni precedenti, per vedere tutti i cambiamenti che sono stati fatti e non perderti niente".

Sembrerebbe una vicenda tecnica, da smanettoni incalliti, ma le conseguenze hanno ricadute che tutti possiamo apprezzare. Sappiamo infatti che un separatista ucraino di nome Strelkov ha reclamato su VKontakte, un social media russo, la paternità dell'abbattimento di un aereo poco dopo lo schianto del Boeing 777 della Malaysia Airline e la morte di tutti i suoi 298 passeggeri. Lo sappiamo solo perché, nonostante Strelkov avesse rapidamente cancellato l'annuncio, questo era stato salvato dalla Wayback Machine, l'applicazione più celebre dell'Archivio, quella che a intervalli regolari setaccia a strascico la rete e fa copie di un miliardo di pagine alla settimana. Sebbene il grosso di questa catalogazione avvenga in automatico, grazie a piccoli e infaticabili software chiamati crawler, nel caso di Strelkov era stato uno specialista di faccende ex sovietiche a segnalare all'Archivio di tenere un occhio su quanto pubblicava quel tipo. È un esempio tra mille.

I bot, un altro modo per chiamare i software cha vanno in giro a fare copie a intervalli variabili (una volta ogni paio di mesi per siti che cambiano poco, più volte al giorno per quelli di notizie), faticano solo davanti ai paywall ("ma anche lì basta pagare un abbonamento per entrare") e davanti ad aggregatori come Apple News, particolarmente ostili all'indicizzazione. Tramandare ai posteri una pagina altrimenti deperibile può avvenire anche per iniziativa popolare: basta copiare l'indirizzo dentro il servizio Save Page Now e una copia sarà preservata, in una sorta di formaldeide elettronica, fin quando l'Archivio avrà soldi per pagare la corrente che fa funzionare i super-computer ospitati al 300 di Funston Avenue. Già che ci siamo arrivati, due parole sulla sede. Bianca come l'Altare della Patria e addirittura più pacchiana, era una chiesa che la Fourth Church of Christ, Scientist, aveva messo in vendita nel 2009. Al pianterreno c'è un grosso spazio comune con una dozzina di scrivanie intorno al quale si aprono varie insenature che corrispondono ad altrettante stanze, tra cui quella di Kahle. Per non dire di una saletta con un paio di sofisticatissimi scanner che possono acquisire un libro in un paio d'ore. Poi altri computer per registrare i video. E altri ancora per gli altri media, compresa una collezione vertiginosa di dischi a 78 giri.

Salendo si arriva nella sala principale, che ha ancora le panche originarie e, al posto dei fedeli, statue colorate che assomigliano a nani da giardino ipertrofici e raffigurano i dipendenti presenti e passati (oggi sono 140, con due ingegneri italiani qui nella sede centrale), che abbiano almeno tre anni di anzianità. Sulla parete dalla parte opposta al pulpito svettano le vere divinità residenziali: tre totem composti ognuno da dieci computer montati uno sull'altro, il vero cervello dell'Archivio. "Ogni lucina che si accende" spiega estasiato Kahle "corrisponde a un essere umano che, da qualche parte nel mondo, ha scaricato un libro o un altro file".

Tenere in piedi tutto questo costa 18 milioni di dollari all'anno, un terzo viene dalle biblioteche che pagano il servizio di scannerizzazione in cui l'Archivio è maestro (solo Google fa meglio di loro: 25 milioni contro 4 milioni di titoli), un terzo da servizi di archiviazione per altre istituzioni culturali e un terzo da donatori privati. "Quest'ultima parte è fortunatamente in crescita" chiosa soddisfatto "e in ogni caso ho disposto delle mie risorse per assicurare che la baracca continui anche dopo di me".

C'è una nuova urgenza nel meritorio lavoro che fanno. Il prima e il dopo si chiama Trump. "All'indomani dei risultati elettorali ho convocato una riunione d'emergenza e ci siamo chiesti come dovevamo e potevamo rispondere a quell'incredibile cambio di scenario" dice facendosi serissimo "e la risposta che mi sono dato è: facendo ciò che facciamo, i bibliotecari, ma ancora meglio". In pratica, con tre mosse. Costruendo un Trump Archive che conservi tutti i discorsi del presidente, tutti i suoi tweet, la stragrande maggioranza delle sue apparizioni televisive a futura memoria (e contro eventuali ritrattazioni). Aumentando considerevolmente il livello di cybersicurezza che proteggeva l'Archivio. Infine facendo una copia di tutto in un altro Stato, il Canada, nel caso in cui il governo decidesse di immischiarsi. A sentirlo parlare, quest'ultima contromisura sembra una cosa banale. Ma non è affatto come copiare una serie tv piratata su una chiavetta. Una volta, per dare l'idea plastica di quanta roba fosse internet, riempì di dischi fissi un container. Tanto pesava.

Nel 2002 Kahle aveva proposto che I.A. diventasse capofila, in collaborazione con varie biblioteche nazionali, di un consorzio di archivi del web. L'auto-candidatura non ebbe seguito ma l'idea germinò l'anno successivo nella creazione dell'International Internet Preservation Consortium, diretto dalla Bibliothèque nationale de France. In America succede ogni giorno che un milionario ben disposto faccia le veci di uno Stato minimo. Quanto a differenze culturali, ce l'ha con l'Unione Europea che ha fatto passare la direttiva sul copyright in chiave anti-piattaforme e pro-giornali (sto semplificando per brevità: cari troll, tirate un bel respirone o andate al mare). Al che, quando alludo al fatto che a forza di mettere a disposizione tutto quel ben di Dio gli editori resteranno in braghe di tela, ci tiene a chiarire un punto cruciale: "Non è così. Perché noi ci comportiamo come una biblioteca: abbiamo un libro, regolarmente comprato, e quello prestiamo. Hai due settimane per leggerlo e poi torna disponibile per il prossimo. Non danneggiamo nessuno". Il che è vero, ma non toglie che per loro natura i file digitali (anche quelli protetti che usano loro) possono essere sprotetti, manipolati e moltiplicati più dei pani e dei pesci. Con inevitabile danno per i titolari della proprietà intellettuale. Ma questo è un discorso lungo, complesso e fatalmente impopolare dal momento che ci sono mille utenti contenti di aver scaricato gratis per ogni autore triste per essere stato letto gratis. In ogni caso una parte del budget andrà per comprare "un milione e mezzo di titoli".

Un progetto enorme a cui stanno lavorando è aggiustare tutte le note a piè di pagina di Wikipedia. La veridicità delle voci dell'enciclopedia online riposa sulle fonti. Peccato che, come spiegava già un citatissimo studio del 2013, quasi metà dei link negli articoli scientifici non è più buono in capo a sei anni. La chiamiano reference rot o link rot. Il link è andato a male, scaduto, non porta più da nessuna parte. "L'idea è di sostituirli tutti" si impegna Kahle "con un colossale e impegnativo trova e sostituisci, con link che puntino a pagine conservate dall'Archivio, che mai cambieranno indirizzo e quindi non daranno problemi". Non solo. Come già intuiva quasi vent'anni fa il direttore del Media Lab Walter Bender, all'epoca dell'inflazione da informazione l'unico vero lusso resta il contesto. Quindi "se una nota rimanda a un libro il link condurrà direttamente alla pagina in cui l'affermazione è contenuta". Mi mostra un esempio di quelli che chiama live link ed è uno spettacolo. Immaginate che mondo sarebbe se ogni affermazione fosse ancorata alla sua fonte, con una verifica a un clic di distanza. E pensate l'impatto devastante su personaggi come Trump che vanta, secondo il vaglio di PolitiFact, una percentuale di menzogna intorno al 70 per cento.

È finalmente arrivato il momento di far entrare in scena la seconda camicia impossibile, a macchie rosse, bianche e turchesi con dei polsini multicolori a quadretti, ovvero quella del capo della Wayback Machine, il principale motore mnemonico dell'archivio. Mark Graham è un cinquantenne con le guance floride che informaticamente parlando ha le mostrine di un generale, avendo praticamente fondato la piattaforma per attivisti PeaceNet e poi lavorato alla comunità online The Well. Il grande limite della Wayback è quello dell'usabilità. Non puoi cercare con parola chiave l'homepage di Repubblica.it di una certa data ma devi sfogliare indietro nel tempo per cercare se quel tal giorno il bot l'abbia immortalata. Infatti stanno lavorando a una nuova interfaccia che renderà la consultazione meno penitenziale. "Per ora facciamo copie di molte pagine di circa 4 mila siti di informazione da oltre 40 nazioni, ma puntiamo ad assestarci a 20 mila. È tanto più importante in un momento in cui populisti con tendenze autoritarie impazzano dappertutto".

Di Twitter, dove molte schermaglie politiche hanno luogo, archiviano solo l'1 per cento, ma la piattaforma si è impegnata dall'inizio a cedere alla Library of Congress una copia integrale di tutta la propria produzione ("Il museo del pattume" come notò un commentatore). Graham accenna a un articolo, Locking the Web Open: a Call for a Decentralized Web, che quattro anni fa, ben prima di Cambridge Analytica e altri scandali che ci hanno definitivamente aperto gli occhi sulla fine dell'èra dell'innocenza internettiana, Kahle aveva presentato alla Ford Foundation. In pratica, sostiene, il web ha due grossi problemi: non è affidabile né rispetta la privacy. Per risolverli entrambi bisognerebbe decentralizzarlo, facendo ospitare le sue pagine non da server singoli ma dall'infinità dei computer degli utenti, secondo lo schema peer-to-peer che rese famoso Napster. A quel punto sarebbe impossibile, o almeno infinitamente più difficile, tanto per la Cina quanto per la Nsa americana, spiare i cittadini. E poi, ovviamente, il web rinnovato dovrebbe avere incorporata una memoria, tener traccia di tutte le versioni di ogni pagina. A quell'incontro partecipava anche Berners-Lee, che da qualche anno lavora a un sostanziale aggiornamento della sua creatura. Il progetto, affiliato al Mit, si chiama Solid. Kahle, biografia e camicia lo dimostrano, non sembra eccessivamente intossicato dalla competizione. Dice: "Dobbiamo incorporare il Primo emendamento nel codice del prossimo web. Dobbiamo spalancarlo a tutti. E rendere irrevocabile quell'apertura". Sui princìpi ha già vinto.

Sul Venerdì del 19 luglio 2019