Hvordan Wikipedia-data revolutionerer influenzaprognoser

Denne gang sidste år lancerede Centers for Disease Control and Prevention i Atlanta en konkurrence for at finde den bedste måde at forudsige karakteristika for influenzasæsonen 2013-2014 ved hjælp af data indsamlet fra internettet. I dag afslører Kyle Hickmann fra Los Alamos National Laboratories i New Mexico og et par venner resultaterne af deres model, som brugte realtidsdata fra Wikipedia til at forudsige grundsandhedsdata indsamlet af CDC, som dukker op omkring to uger senere.





De siger, at deres model har potentialet til at transformere influenzaprognoser fra en sort kunst til en moderne videnskab, der er lige så velfunderet som vejrudsigt.

Influenza tager mellem 3.000 og 49.000 liv hvert år i USA, så en nøjagtig prognose kan have en betydelig indflydelse på den måde, samfundet forbereder sig på epidemien. Den nuværende metode til at overvåge influenzaudbrud er noget forældet. Den er afhængig af et frivilligt system, hvor offentlige sundhedsembedsmænd rapporterer procentdelen af ​​patienter, de ser hver uge med influenzalignende sygdomme. Dette er defineret som procentdelen af ​​mennesker med en temperatur højere end 100 grader, hoste og ingen anden forklaring end influenza.

Disse tal giver en fornemmelse af forekomsten af ​​influenza på ethvert tidspunkt, men nøjagtigheden er klart begrænset. De tager for eksempel ikke højde for personer med influenza, som ikke søger behandling, eller personer med influenzalignende symptomer, som søger behandling, men ikke har influenza.



Der er et andet væsentligt problem. Netværket, der rapporterer disse data, er relativt langsomt. Det tager omkring to uger for tallene at filtrere gennem systemet, så dataene er altid uger gamle.

Derfor er CDC interesseret i at finde nye måder at overvåge spredningen af ​​influenza i realtid. Google har især brugt antallet af søgninger efter influenza og influenzalignende symptomer til at forudsige influenza i forskellige dele af verden. Den tilgang har haft betydelig succes, men også nogle gådefulde fiaskoer. Et problem er imidlertid, at Google ikke stiller sine data frit til rådighed, og denne mangel på gennemsigtighed er en potentiel kilde til problemer for denne form for forskning.

Så Hickmann og co har henvendt sig til Wikipedia. Deres idé er, at variationen i antallet af mennesker, der får adgang til artikler om influenza, er en indikator for spredningen af ​​sygdommen. Og da Wikipedia gør disse data frit tilgængelige for enhver interesseret part, er det en fuldstændig gennemsigtig kilde, der sandsynligvis vil være tilgængelig i en overskuelig fremtid.



Hickman og co bruger influenzaartikeldata fra tidligere år til at træne en maskinlæringsalgoritme til at se sammenhængen med de influenzalignende sygdomstal indsamlet af CDC. De brugte derefter algoritmen til at forudsige influenzaniveauer i realtid under sidste års influenzasæson.

Resultaterne er en god forudsigelse for de jordsandhedsdata, som CDC stiller til rådighed to uger senere. Adgangslogfiler til Wikipedia-artikler har vist sig at være stærkt korrelerede med historiske influenzalignende sygdomsregistre og giver mulighed for nøjagtig forudsigelse af influenzalignende sygdomsdata flere uger før de bliver tilgængelige, siger Hickmann og co.

Der er dog en advarsel. Et problem er, at prognoserne markant undervurderer størrelsen af ​​slutningen af ​​influenzasæsonen. Det er sandsynligvis, fordi folk har en tendens til ikke at vende tilbage til Wikipedia-influenza-artiklerne, hvis de blev geninficeret med en anden influenza-stamme, som er en væsentlig kilde til sygdommen sent på sæsonen. Da vores model ikke tager højde for reinfektion eller flere influenzastammer, forudsiges epidemiens hale ikke godt efter, at toppen af ​​influenzasæsonen er forbi, indrømmer de.



Ikke desto mindre er arbejdet et vigtigt skridt i retning af et forudsigelsessystem, der er lige så detaljeret og velfunderet som vejrudsigten. En nyttig funktion ved deres metode er, at den viser, hvornår modellen afviger fra grundsandhedens data. Det gør det muligt at justere i realtid for at tage højde for disse forskelle, ligesom en vejrudsigt.

Sygdomsprognose er en videnskab i sin vorden, men den har potentialet til drastisk at forbedre den medicinske verdens niveau af forberedelse til epidemier. De grove skøn, som læger har måttet arbejde med indtil nu, fører ofte til betydelige niveauer af over- eller underforberedelse.

Det ser ud til at ændre sig. Og med influenzasæsonen 2014-2015 allerede over os, jo før jo bedre.



Ref: arxiv.org/abs/1410.7716 : Forudsigelse af influenzasæsonen 2013–2014 ved hjælp af Wikipedia

skjule