211service.com
Hvordan opbevarer genomsekventeringscentre sådanne enorme mængder data?
Genomisk sekventering er hurtigt gået fra noget, der kun er muligt i et nationalt forskningsprojekts skala til noget, der kan udføres hurtigt og endda billigt (se Er det virkelig kun $1.000 at sekvensere et genom?). Mængden af DNA, der analyseres i dag, er svimlende – og det samme er behovene for datalagring.
gigabyte
At afkode alle seks milliarder baser eller bogstaver på det menneskelige genom er ikke en ligetil opgave. Gensekventeringsudstyr læser relativt små stykker DNA ad gangen og samler gradvist nok overlappende information til at opbygge en komplet udlæsning af genomet. Den første runde af datafangst fanger enorme mængder af rå information, svarende til millioner af rå billeder, og genererer terabyte af data.
I de tidlige dage med sekventering blev alle disse rådata bevaret, men nyere udstyr dumper de rå billeddata efter behandling og genererer en komprimeret fil, der repræsenterer genomet i omkring 100 gigabyte. Den fil indeholder betydelig oversampling af genomet - ofte med en faktor på mindst 30 - for at sikre, at der er tilstrækkelig pålidelig information, siger Ilya Chorny, markedschef i virksomhedens informatikenhed hos Illumina, en førende producent af gensekventeringsudstyr .
En slags afklebet præcision på omkring en gigabyte kan bruges i nogle tilfælde, men det giver en lavere grad af tillid til nøjagtigheden. Michael Schatz, lektor i kvantitativ biologi ved Cold Spring Harbor Laboratory, siger, at 100 gigabyte er et godt benchmark til at fremskrive lagringskravene for ethvert enkelt menneskeligt genom i løbet af det næste årti.
I betragtning af de lave omkostninger ved datalagring kan det virke som om det hurtigt voksende behov for det ikke burde være et problem for genomiske centre. Overvej, at et fire-terabyte-drev designet til at være pålideligt nok til virksomheder kan køre så lidt som $130. Fire terabyte er 4.000 gigabyte, eller nok til at rumme 40 genomer, hvilket betyder, at hver enkelt vil bruge omkring 3 dollars lagerkapacitet plus lidt ekstra til redundant offline backup.
Men mange institutioner genererer nu hundredvis af terabyte data om måneden og skal gemme dem i en form, der er let tilgængelig over hele verden. Illumina tilbyder en sådan cloud-storage-tjeneste, men der er stigende konkurrence. I slutningen af 2014 begyndte Google Genomics at tilbyde at gemme genomiske data for 2,2 cents per gigabyte om måneden, hvilket svarer til $26 om året for 100 gigabyte. Amazon Web Services tilbyder også genomics-tjenester. Den offentliggør ikke en offentlig prisliste; dets standardlagergebyrer ville være omkring $35 om året for 100 gigabyte.
Fremtidigt chok
Datakravene vil blive endnu mere intense. Mens DNA'et i hver celle oprindeligt blev set som en konsistent plan for hele væsenet, er det bestemt ikke sandt, siger Schatz. Genetisk forskning har fundet en stor variation mellem forskellige celler i den samme person eller anden organisme. Det kan betyde, at mere end én forekomst af en persons genom skal opbevares. Disse yderligere data kan give sig selv til væsentlig kompression, da kun forskellene mellem DNA i forskellige celler muligvis skal lagres i stedet for genomerne som helhed. Men komprimering øger den beregningsmæssige byrde, når dataene skal tilgås og analyseres; hvis lagring er billigere end de nødvendige beregninger, kan det være fornuftigt at holde dataene tilgængelige på en mindre effektiv måde.
Schatz og ni kolleger ved University of Illinois i Urbana-Champaign offentliggjorde i juli et papir, der forsøgte at få styr på de kommende opbevaringskrav til sekventering. Efterhånden som teknologien bliver bedre og billigere, vurderer de, vil et sted mellem 100 millioner og to milliarder menneskelige genomer blive lagret i 2025. Denne vækst overstiger tempoet i datakravene for andre massive og voksende lagerbrugere – herunder YouTube i særdeleshed, og astronomi som et hele.
Tak til Nidhan Biswas for dette spørgsmål. Hvis du har en, så send den til [email protected]