211service.com
Lektioner fra pandemiens superstjerne-dataforsker, Youyang Gu
Fru Tech | Høflighed Foto
Dataforskeren Youyang Gu tænker på sig selv som en realist - han erklærer det i sit Twitter profil : Oplægsholder af upartiske optagelser. Realist.
Da han bemærkede scattershot-covid-19-fremskrivningerne sidste forår - en model forventede 2 millioner amerikanske dødsfald inden sommeren, en anden forudsagde 60.000 - satte Gu spørgsmålstegn ved, om det var så godt, som modelleringen kunne være. Han besluttede at prøve at lave en covid-19-model selv. Hele mit mål var at producere den mest præcise model som muligt, siger Gu fra sin lejlighed på Manhattan. Ingen 'hvis dette' eller 'hvis det.' Dybest set ingen 'hvis'. Det er lige meget, hvad scenarierne er. Jeg ville bare lægge det ud: 'Dette er den mest sandsynlige eller realistiske prognose for, hvad der kommer til at ske.'
Inden for en uge havde han bygget en maskinlæringsmodel og lanceret sin COVID-19 Projections hjemmeside . Han kørte modellen hver dag - det tog kun en time på hans bærbare computer - og postede dødsprognoser for covid-19 for 50 amerikanske stater, 34 amter og 71 lande.
Relateret historie
Kan covid føre til en levetid med autoimmun sygdom?Der vokser vidnesbyrd om, at hos nogle mennesker producerer covid-infektioner autoantistoffer rettet mod kroppens organer. Hvis det er sandt, kan det betyde årevis med vedvarende sygdom og elendighed for mange.
I slutningen af april tiltrak han opmærksomhed - i sidste ende tjekkede millioner hans hjemmeside dagligt. Carl Bergstrom, professor i biologi ved University of Washington, lagde mærke til og kommenterede på Twitter at Gus model lavede forudsigelser, der virkede lige så gode som dem, jeg har set.
Jeg kan godt være lidt af en ML-skeptiker. Men i dette tilfælde, lad ikke teksten 'machine learning' narre dig til at tro, at dette er slangeolie, tweetede Bergstrom.
En MIT-kandidat med en mastergrad i elektroteknik og datalogi (plus en grad i matematik), Gu, 27, havde arbejdet på en opstart af sportsanalyse, da pandemien ramte. Men han satte denne satsning på pause, da major league-sport lukkede ned. Og så, ved blot at google epidemiologi, begyndte han sit indtog i covid-19-modellering.
Jeg havde ingen baggrund i modellering af infektionssygdomme, siger han. Men han havde et par års erfaring som dataforsker inden for finans, hvor han arbejdede med statistiske modeller - modeller, der baseret på visse statistiske antagelser analyserer data og laver fremskrivninger om for eksempel, hvor prisen på en aktie vil være i fremtiden .
Det viser sig, at en masse modellering af infektionssygdomme grundlæggende er statistisk modellering, siger Gu. Og finansindustriens overskudsdrevne mål for nøjagtighed tjente ham godt på det epidemiologiske område. Hvis du ikke kan lave en præcis model inden for økonomi, har du ikke et job mere, siger han. I modsætning hertil er målet i den akademiske verden - fra Gus perspektiv i det mindste - ikke så meget at lave præcise modeller, men snarere at udgive artikler og informere offentlig politik. Dermed ikke sagt, at de ikke laver præcise modeller - bare at de ikke optimerer specifikt for nøjagtighed, siger han.
Gus model kombinerer maskinlæring med en klassisk infektionssygdomssimulator kaldet en SEIR-model (der tages hensyn til individer i befolkningen, som er modtagelige, udsatte, smitsomme, restituerede eller fjernet på grund af død).
SEIR-komponenten bruger som input et simuleret sæt parametre - et bedste gæt-interval for variabler såsom det grundlæggende reproduktionsnummer (den hastighed, hvormed nye tilfælde opstår i en fuldstændig modtagelig population ved starten af et udbrud, før interventioner eller immunitet) , infektionsrate, lockdown-dato, genåbningsdato og effektive reproduktionsnummer (den hastighed, hvormed nye tilfælde opstår efter nogle indgreb). Med hensyn til output beregner SEIR-simulatoren først infektionerne over tid og beregner derefter dødsfaldene (multiplicerer infektioner med infektionsdødeligheden).
Gus maskinlæringslag genererer derefter tusindvis af forskellige kombinationer for disse parametersæt i forsøget på at finde de virkelige parametre for hver geografisk region. Den lærer, hvilke parametre der genererer de mest nøjagtige dødsfremskrivninger ved at sammenligne SEIR-forudsigelserne med rigtige data om daglige dødsfald fra Johns Hopkins University. Den forsøger at finde ud af, hvilke parametersæt der genererer dødsfald, der bedst matcher de faktiske observerede data, når man ser tilbage, siger Gu. Og så bruger den disse parametre til at forudsige og lave fremskrivninger om dødsfald i fremtiden.
Prognoserne viste sig bemærkelsesværdigt nøjagtige. For eksempel optrådte han den 3. maj CNN i aften og delte sin models fremskrivninger om, at USA ville nå 70.000 dødsfald den 5. maj, 80.000 dødsfald den 11. maj, 90.000 dødsfald den 18. maj og 100.000 dødsfald den 27. maj. Den 28. maj tweeted , covid19-projections.com fik alle 4 datoer nøjagtigt korrekte. Med en vis afrunding var det rigtigt.
Jeg siger ikke, at jeg har været perfekt i løbet af det sidste år. Jeg har taget fejl mange gange. Men jeg tror, vi alle kan lære at nærme os videnskaben som en metode til at finde sandheden frem for selve sandheden.
Youyang Gu
Modellen var selvfølgelig ikke perfekt, men den imponerede Nicholas Reich, en biostatistiker og forsker i infektionssygdomme ved University of Massachusetts, Amherst, hvis laboratorium i samarbejde med US Centers for Disease Control and Prevention, samler resultater fra omkring 100 internationale modelhold. Blandt alle de aggregerede modeller, observerede Reich, var Gus model konsekvent blandt de øverste.
Den 6. oktober offentliggjorde Gu sin endelige dødsprognose, lige før faldbølgen. Modellen forventede, at der ville være 231.000 dødsfald i USA den 1. november. Det samlede antal registreret på den dato: 230.995.
Gu lukkede sin første model ned i begyndelsen af oktober, fordi der på det tidspunkt var masser af hold, der lavede gode dødsprognoser. Han vendte sig i stedet til at modellere sande infektioner versus rapporterede infektioner. Og så i december begyndte han at spore vaccineudrulning og det undvigende klappe h til flokimmunitet — som han i begyndelsen af 2021 reviderede til vej til normalitet. Hvorimod flok immunitet opnås, når en tilstrækkelig del af en befolkning er immun over for virussen, og dermed begrænser yderligere spredning, definerer Gu normalitet som ophævelse af alle covid-19-relaterede restriktioner for størstedelen af amerikanske stater.
Relateret historie
Hvordan en lille medievirksomhed hjælper folk med at blive vaccineret Med mange mennesker, der stadig kæmper for at få covid-skud i New York, har et lokalt nyhedsbrev fungeret som en vaccine-matchmaker.
Det blev klart, at vi ikke kommer til at nå flokimmunitet i 2021, i hvert fald bestemt ikke i hele landet, siger han. Og jeg tror, det er vigtigt, især hvis du forsøger at indgyde tillid, at vi laver fornuftige veje til, hvornår vi kan vende tilbage til det normale. Vi bør ikke knytte det til et urealistisk mål som at nå flokimmunitet. Jeg er stadig forsigtigt optimistisk om, at min oprindelige prognose i februar, for en tilbagevenden til normalen om sommeren, vil være gældende.
I begyndelsen af marts pakkede han butikken helt sammen - han regnede med, at han havde ydet det bidrag, han kunne. Jeg ville træde tilbage og lade de andre modelbyggere og eksperter gøre deres arbejde, siger han. Jeg ønsker ikke at rode i rummet.
Han holder stadig øje med dataene, laver forskning og analyser – på varianterne, vaccineudrulningen og den fjerde bølge. Hvis jeg ser noget, der er særligt bekymrende eller bekymrende, som jeg tror, folk ikke taler om, vil jeg helt sikkert lægge det ud, siger han. Men indtil videre har han fokus på andre projekter, som f.eks YOLO aktier , en aktie-ticker-analyseplatform. Hans vigtigste pandemiske arbejde er som medlem af Verdenssundhedsorganisationens tekniske rådgivende gruppe om covid-19 dødelighedsvurdering, hvor han deler sin outsiders ekspertise.
Jeg har bestemt lært meget det seneste år, siger Gu. Det var meget øjenåbnende.
Lektion #1: Fokuser på grundlæggende
Fra det datavidenskabelige perspektiv har mine modeller vist vigtigheden af enkelhed, som ofte er undervurderet, siger Gu. Hans dødsprognosemodel var enkel i ikke kun dens design - SEIR-komponenten med et maskinlæringslag - men også dens meget afgrænsede, bottom-up tilgang til inputdata. Bottom-up betyder, at man starter med et minimum af bare knogler og tilføjer kompleksitet efter behov, siger han. Min model bruger kun tidligere dødsfald til at forudsige fremtidige dødsfald. Den bruger ikke nogen anden reel datakilde.
Gu bemærkede, at andre modeller trak på en eklektisk variationsdata om tilfælde, hospitalsindlæggelser, test, mobilitet, maskebrug, komorbiditeter, aldersfordeling, demografi , sæsonbestemt lungebetændelse, årlig lungebetændelsesdødsrate, befolkningstæthed, luftforurening, højde, rygedata, selvrapporterede kontakter, flypassagertrafik, plejested, smarte termometre, Facebook-opslag, Google-søgninger og mere.
Der er denne tro på, at hvis man tilføjer mere data til modellen, eller gør den mere sofistikeret, så vil modellen klare sig bedre, siger han. Men i virkelige ord-situationer som pandemien, hvor data er så støjende, vil du gerne holde tingene så enkle som muligt.
Jeg besluttede tidligt, at tidligere dødsfald er den bedste forudsigelse for fremtidige dødsfald. Det er meget enkelt: input, output. Tilføjelse af flere datakilder vil blot gøre det sværere at udtrække signalet fra støjen.
Lektion #2: Minimer antagelser
Gu mener, at han havde en fordel ved at nærme sig problemet med et blankt tavle. Mit mål var bare at følge dataene om covid for at lære om covid, siger han. Det er en af de vigtigste fordele ved en outsiders perspektiv.
Men da Gu ikke var epidemiolog, skulle han også være sikker på, at han ikke lavede forkerte eller unøjagtige antagelser. Min rolle er at designe modellen, så den kan lære antagelserne for mig, siger han.
Når der kommer nye data, der går imod vores overbevisning, har vi nogle gange en tendens til at overse de nye data eller ignorere dem, og det kan have konsekvenser hen ad vejen, bemærker han. Jeg oplevede bestemt, at jeg blev offer for det, og det ved jeg, at mange andre mennesker også har.
Så det er virkelig vigtigt at være opmærksom på den potentielle skævhed, vi har og genkende den, og at være i stand til at justere vores forudsætninger – at justere vores overbevisninger, hvis nye data modbeviser dem – især i et hurtigt bevægende miljø som det, vi har set med covid. .
Lektion #3: Test hypotesen
Det, jeg har set i løbet af de sidste par måneder, er, at enhver kan fremsætte påstande eller manipulere data, så de passer til fortællingen om, hvad de vil tro på, siger Gu. Dette understreger vigtigheden af blot at lave testbare hypoteser.
For mig er det hele grundlaget for mine fremskrivninger og prognoser. Jeg har et sæt antagelser, og hvis de antagelser er sande, så er det det, vi forudser vil ske i fremtiden, siger han. Og hvis antagelserne ender med at være forkerte, så må vi selvfølgelig indrømme, at de antagelser, vi laver, ikke er sande og justerer derefter. Hvis du ikke laver testbare hypoteser, så er der ingen måde at vise, om du faktisk har ret eller forkert.
Lektion #4: Lær af fejl
Ikke alle de fremskrivninger, jeg lavede, var korrekte, siger Gu. I maj 2020 forventede han 180.000 dødsfald i USA i begyndelsen af august. Det er meget højere, end vi så, husker han (der var omkring 155.000 dødsfald). Hans testbare hypotese viste sig at være forkert - og det tvang mig til at justere mine antagelser.
På det tidspunkt brugte Gu en fast infektionsdødsrate på cirka 1 % som en konstant i SEIR-simulatoren. Da han om sommeren sænkede infektionsdødeligheden til omkring 0,4% (og senere til omkring 0,7%), vendte hans fremskrivninger tilbage til et mere realistisk område.
Lektion #5: Engager kritikere
Ikke alle vil være enige i mine ideer, og det hilser jeg velkommen, siger Gu, der brugte Twitter til at poste sine fremskrivninger og analyser. Jeg forsøger at svare folk, så meget jeg kan, og forsvare min holdning og debattere med folk. Det tvinger dig til at tænke over, hvad dine antagelser er, og hvorfor du tror, de er korrekte.
Det går tilbage til bekræftelsesbias, siger han. Hvis jeg ikke er i stand til at forsvare min holdning ordentligt, er det så virkelig det rigtige krav, og skal jeg fremsætte disse påstande? Det hjælper mig med at forstå, ved at engagere mig med andre mennesker, hvordan man tænker på disse problemer. Når andre mennesker fremlægger beviser, der modarbejder mine holdninger, er jeg nødt til at være i stand til at erkende, hvornår jeg kan være forkert i nogle af mine antagelser. Og det har faktisk hjulpet mig enormt med at forbedre min model.
Lektion #6: Udvis sund skepsis
Jeg er nu meget mere skeptisk over for videnskab - og det er ikke en dårlig ting, siger Gu. Jeg synes, det er vigtigt altid at stille spørgsmålstegn ved resultater, men på en sund måde. Det er en fin linje. For mange mennesker afviser simpelthen videnskaben, og det er heller ikke måden at gå på.
Men jeg tror også, det er vigtigt ikke bare blindt at stole på videnskaben, fortsætter han. Forskere er ikke perfekte. Det er passende, siger han, hvis noget ikke virker rigtigt, at stille spørgsmål og finde forklaringer. Det er vigtigt at have forskellige perspektiver. Hvis der er noget, vi har lært i løbet af det seneste år, så er det, at ingen har 100 % ret hele tiden.
Jeg kan ikke tale på vegne af alle videnskabsmænd, men mit job er at skære igennem al støjen og komme frem til sandheden, siger han. Jeg siger ikke, at jeg har været perfekt i løbet af det sidste år. Jeg har taget fejl mange gange. Men jeg tror, vi alle kan lære at nærme os videnskaben som en metode til at finde sandheden frem for selve sandheden.