At bryde genomets flaskehals





De genomiske data, der genereres fra næste generations sekventeringsmaskiner, udgør ikke meget mere end alfabetsuppe, hvis det ikke er udsat for betydelig beregningsmæssig behandling og statistisk analyse. For at dataene skal være nyttige, er tricket at omdanne disse As, T'er, G'er og C'er til en overskuelig beskrivelse af sygdomsrisici og andre genetiske dispositioner. Det kræver en masse regnekraft og tid - allerede en betydelig flaskehals for nogle genomiske analysevirksomheder (se Baser til bytes, maj/juni, 2012) .

Flere virksomheder ser på skyen som en måde at hjælpe dem med at analysere alle data. Tanken er, at forskere kan sende deres data til en web-hostet analysetjeneste, der vil behandle rådata til en genetisk profil. Datafilerne genereret af sekventeringsmaskiner er dog så massive (se Baser til bytes, marts/april 2012) at det banale problem med at uploade store filer til skyen bliver sit eget problem. Strategien for en Redwood City, Californien-baseret startup kaldet Bina Technologies er at dele og erobre: ​​give kunderne en intern data-knusningsmaskine, der vil forvandle et bjerg af rå sekvens til let delte genetiske profiler. Disse profiler kan derefter hurtigt uploades til Bina Technologies' cloud-hostet websted til datastyring, deling og aggregering.

Gruppen planlægger at sælge sin såkaldte Bina Box forudindlæst med software, der kan reducere de omkring 300 gigabyte af rå data fra et menneskeligt genom til et par hundrede megabyte af genetisk information. Boksen vil uploade det komprimerede datasæt til Binas cloud-tjeneste til lagring, deling og yderligere analyse. Bina Box kan gøre det indledende tunge løft og gøre dataene små nok til at sende til skyen, siger Narges Bani Asadi, grundlægger af Bina.



Bina Technologies siger, at dets system udfører denne indledende behandling af genomiske data ved hastigheder, der er størrelsesordener hurtigere end værktøjer, der stilles til rådighed af Bredt Institut , MIT-Harvards fælles genomcenter. Det, der tager omkring en uge ved at bruge Broads genomvariationsanalysepipeline på en avanceret otte-kernemaskine på Amazons sky, kan gøres på omkring to timer på en Bina Box, siger Asadi. Virksomheden forventer at offentliggøre en fuldstændig beskrivelse af sin sammenligning med andre analysepipelines i de kommende måneder.

Bina Technologies planlægger at arbejde med nogle få genomics-grupper som en del af en pilottestfase for sit system. En gruppe i tidlig samtale med Bina Technologies er Foundation Medicin , et kræftgenomisk firma i Cambridge, Massachusetts (se Foundation Medicine: Personalizing Cancer Drugs, marts/april 2012). Mens det team, der er ansvarligt for at forberede prøver og generere rå sekvensdata, har været i stand til at skalere sine processer op for at imødekomme efterspørgslen, er det samme ikke tilfældet for beregningsanalysen, siger Maureen Cronin, senior vice president for forskningssamarbejde med Foundation Medicine, og en rådgiver for Bina Technologies. Hun siger, at alle data, der streames fra Foundation Medicines sekventeringsmaskiner, har skabt noget af et beregningsproblem.

For at være sikker på de mutationer, de identificerer, siger Cronin, sekvenserer Foundation Medicine en patients genom med et gennemsnit på 500X dækning - det vil sige, at hvert eneste af de tre milliarder basepar i det menneskelige genom replikeres omkring 500 gange. Disse rådata, milliarder af korte blips af genomet, hver et par dusin basepar lange, skal derefter bearbejdes til længere kromosomsekvenser. Denne samlingsproces efterfølges af en sammenligning af et individs genom med en referencestandard - resultatet af det menneskelige genom-projekt. Alt dette skal ske, før nogen klinisk fortolkning af en tumor eller et andet genom overhovedet kan begynde. Det er en utrolig beregningsintensiv proces, siger Cronin.



skjule