De nye faldgruber ved Nowcasting med Big Data

Tidligere i år afholdt Den Europæiske Centralbank en to-dages workshop om big data, og hvordan det kan bruges til prognoser. Hovedtaleren var Hal Varian, cheføkonom hos Google og en række af rockstjernestatus.





Varian skitserede styrken af ​​Google Trends og Google Correlate, virksomhedens big data-værktøjer. Med Google Trends indtaster du en forespørgsel og får en dataserie af aktivitet tilbage. Med Google Correlate går du ind i en dataserie og får en liste over forespørgsler tilbage, hvis dataserie følger et lignende mønster, siger Google på sin Correlate-hjemmeside. Google Correlate er med andre ord som Google Trends omvendt.

Varian viste alle mulige interessante tendenser og sammenhænge. For eksempel stiger søgninger efter ordet tømmermænd betydeligt på en lørdag, topper på en søndag og falder markant på en mandag. Og mønsteret ligner mønsteret for søgninger efter ordet vodka, omend det halter med en dag (eller mere sandsynligt, en nat og en morgen efter).

I et andet eksempel viste han, hvordan indtastning af data om oprindelige ansøgninger om arbejdsløshedsunderstøttelse i USA returnerede en liste med 100 forespørgsler, der fulgte et lignende mønster, inklusive udtrykket tilmeld dig arbejdsløshed.



Der er selvfølgelig grænser. Han viste en falsk sammenhæng mellem salg af biler i USA og søgeforespørgslen indiske restauranter mellem 2004 og 2012. Det er ikke klart, hvorfor disse to datasæt følger lignende tendenser, men som enhver statistiker vil fortælle dig, betyder korrelation ikke årsagssammenhæng.

Budskabet var klart. Søgeforespørgselsdata er enormt kraftfulde, men skal behandles med en vis omhu og forsigtighed.

I dag siger Paul Ormerod fra University College London og et par venner, at der er andre grunde til at være forsigtig. Disse fyre har undersøgt Google Flu Trends-data, hvor Google bruger antallet af influenza-relaterede søgninger til nu at afsløre forekomsten af ​​influenza i forskellige dele af verden på et bestemt tidspunkt.



Ormerod og co siger, at der er flere imponerende eksempler, hvor Google nøjagtigt har estimeret antallet af influenzatilfælde, for eksempel i USA i 2011/12, Schweiz 2007/8, Tyskland 2005/6 og Belgien 2007/8. Denne evne til at overvåge influenza har fået bred opmærksomhed i medierne.

Mindre kendte er de tilfælde, hvor Google Trends markant overvurderede det faktiske antal influenzatilfælde. Dette skete i USA i vinteren 2012/13, i Schweiz i 2008/9, Tyskland i 2008/9 og Belgien i 2008/9.

Hvorfor forskellen? Ormerod og co antager, at folk, der foretager influenza-relaterede søgninger, falder i to kategorier. Den første er dem, der lider af symptomer på influenza, og den anden gruppe søger blot, fordi andre mennesker også søger, måske på grund af stærk medieinteresse for influenza for eksempel.



Naturligvis kommer de nyttige data fra den første gruppe, der er influenzaramte. Deres grund til at søge er internt genereret og uafhængig af den ydre verden - de føler sig syge. Så deres søgningsmønster bør være anderledes end folk, der søger på grund af ydre påvirkninger som avisrapporter. Denne proces med social søgning tjener simpelthen til at puste tallene op.

Så hvordan kan man adskille disse to grupper? Ormerod og co antager, at mønsteret af uafhængige søgninger over tid vil adskille sig væsentligt fra sociale søgninger. De siger især, at uafhængige søgninger burde stige hurtigt, efterhånden som influenza fejer gennem befolkningen og falde langsomt, efterhånden som sygdommen dør ud. Derimod er sociale søgninger mere symmetriske.

Så symmetrien i dataene er et mål for niveauet af social søgning. De viser faktisk, at denne symmetri er klart mere tydelig i de år, hvor Google Flu Trends væsentligt overvurderede tilfælde sammenlignet med år, hvor den var mere nøjagtig.



Det er et interessant eksempel på den slags faldgruber, som statistikere skal forhandle sig frem til, når de analyserer big data. Google Trends er blot et eksempel – verden er i stigende grad oversvømmet med store datasæt og med statistikere, der slikker sig om munden.

Der er ingen tvivl om, at vigtig information vedrørende økonomi, sundhed og andre ting kan udvindes fra big data med de rigtige værktøjer. Men præcis, hvordan dette skal gøres præcist og pålideligt, er stadig genstand for betydelig debat.

Det er ikke helt anderledes end den situation, der eksisterer med aktuelle økonomiske data, som generelt halter realøkonomien med mindst en måned og ofte revideres senere, når tallene er klarere. Upålideligheden af ​​disse tal er en kilde til betydelig bekymring for politikere.

Det synes klart, at offentlige myndigheder, virksomheder og næsten alle, der er villige til at lege med tallene, vil være i stand til at udtrække betydelig værdi fra søgeforespørgselsdata i fremtiden.

Men vær advaret, der er behov for betydelig omhu. Det er ikke kun vodka, der efterlader en grim smag i munden den følgende morgen. Mange økonomiske tømmermænd er blevet forårsaget af overdreven hengivenhed med upålidelige data.

Ref: arxiv.org/abs/1408.0699 : Nowcasting økonomiske og sociale data: Hvornår og hvorfor søgemaskinedata mislykkes, en illustration, der bruger Google influenza-tendenser

skjule