Twitter Data Scientist tager på McDonald's hele menuen, overlever

Edwin Chen er en dataforsker på Twitter, der er interesseret i at dele de mystiske hemmeligheder af sin mørke kunst, hvilket er en god ting i betragtning af, at det sandsynligvis er det hurtigst voksende felt i U.S.A.





Mmmm, datavidenskab. (cc Evan Blaser )

(Nedenfor har jeg inkluderet hele et e-mail-interview, jeg gennemførte med Chen, som du måske ønsker at springe til, hvis du leder efter et generelt overblik over hans arbejde. Han afslører bl.a., at han overvejer at mine Twitter data for at se, om folk spiser fastfood, når de er triste.)

Datavidenskab er så nyt, at der ikke er nogen lærebøger om emnet, og ingen universitetspensum designet til at vise sig at være dataforskere. Alligevel er det integreret i alt fra kvantitativ handel på Wall Street til annoncemålretning på nettet og optimering af forsyningskæder i den virkelige verden.



Før han udvindede terabytes af tweets for at få indsigt, der kunne omdannes til interaktive visualiseringer, finpudsede Chen sine færdigheder med at studere lingvistik og ren matematik på MIT. Det er typisk atypisk for en dataforsker, som har baggrund i matematisk strenge discipliner, uanset hvad de er. (På Twitter, f.eks. alle dataforskere skal have mindst en kandidatgrad inden for et beslægtet felt .)

Her er et af de mere skøre eksempler på datavidenskabens alsidighed, fra Chens egen blog. I et indlæg med den medrivende titel Uendelige blandingsmodeller med ikke-parametriske Bayes og Dirichlet-processen , Chen dykker ned i problemet med klyngedannelse. Det vil sige, hvordan tager man en masse data og sorterer den i grupper af relaterede emner? Det er et hårdt problem - hvor mange grupper skal der være? hvad er kriterierne for at sortere dem? - og detaljerne i, hvordan han tackler det, er hinsides dem, der ikke har baggrund i denne form for analyser.

For os andre giver Chen et konkret og tilgængeligt eksempel: McDonald's



Ved at dumpe hele McDonald's menu i sin matematiske sorteringsboks opdager Chen for eksempel, at ikke alle McDonald's saucer er skabt lige. Hot Mustard og Spicy Buffalo falder ikke i samme klynge som Creamy Ranch, der har mere til fælles med McDonald's iskaffe med sukkerfri vaniljesirup, end det gør med Newman's Own Low Fat Balsamic Vinaigrette.

Andre klynger dukker op, inklusive alle burger-y-varer, morgenmadsmad og sukkerdrikke. Indtil videre er det ikke så overraskende, indtil du kommer til den ene klynge på McDonald's menu, der kun indeholder ét element.

Hvad er så specielt ved McDonald's Fruit & Maple Oatmeal? Det er sandsynligvis dets fiberindhold, relativt (jeg understreger relativt) høje niveauer af næringsstoffer og lavere niveauer af sukker, transfedt og kolesterol.



Med andre ord, når en af ​​Twitters nyeste dataforskere anvender sit håndværk til McDonald's menu, udtrækker hans algoritme automatisk den eneste mad på den, som nogen af ​​os nok burde overveje at spise. Havregrød: Hos McDonald's er det virkelig i en klasse for sig.

Her er hele interviewet med Chen:

1. Hvor længe har du været dataforsker hos Twitter?



Jeg har været på Twitter i omkring fire måneder.

2. Hvad laver en dataforsker hos Twitter?

Vi arbejder på alt fra at bygge maskinlæringsmodeller og forbedre vores store databehandlingsrammer, til at skabe datavisualiseringer, køre statistiske analyser og finde bedre måder at forstå vores brugere og Twitter-grafen på. Der er meget forskelligt, og det afhænger virkelig af hver persons færdigheder og interesser.

På ethvert givet tidspunkt vil jeg for eksempel sandsynligvis eksperimentere med nye annoncemålretningsalgoritmer, skrive MapReduce-job for at udvinde terabytes af tweets (ved at bruge Scalding, vores interne MapReduce-sprog), bygge interaktive visualiseringer for at få indsigt i alle data, vi indsamler, skriver en rapport for at forklare nogle nye resultater, kører et eksperiment på Mechanical Turk og meget mere.

3. Blev dit seneste indlæg (om klyngedannelse) inspireret af noget, du arbejder på på Twitter (som du kan diskutere)?

Jeg har arbejdet noget med at gruppere vores brugere og annoncører, automatisk udlede emnekategorier i tekst og tænke på, hvad vi kan lære af mad på Twitter (for eksempel er mænd og kvinder eller san-franciskanere og newyorkere forskellige i hvad de spiser? er der nogen sammenhæng mellem, hvad folk spiser, og hvad de tweeter, f.eks. er folk mere tilbøjelige til at spise junkfood, når de er triste?). Så selvom indlægget ikke var direkte inspireret af det, jeg arbejder med på Twitter, er det bestemt relateret.

4. Datavidenskab er en ting nu, men (har jeg fået at vide) feltet er så nyt, at der ikke er nogen lærebøger eller universitetskurser, der er specifikke for det. Er du enig/uenig?

Jeg er enig – men det afhænger af din definition af datavidenskab (som mange mennesker er uenige om!). For mig er datavidenskab en blanding af tre ting: kvantitativ analyse (for den strenghed, der er nødvendig for at forstå dine data), programmering (så du kan behandle dine data og handle på din indsigt) og historiefortælling (for at hjælpe andre med at forstå, hvad datamidler). Så nyttige færdigheder for en dataforsker at have kunne omfatte:

* Statistik, maskinlæring (på den kvantitative analyseside). For eksempel er det umuligt at udtrække mening fra dine data, hvis du ikke ved, hvordan du kan skelne dine signaler fra støj. (Jeg vil dog understrege, at jeg mener, at enhver form for stærk kvantitativ evne er fint – min egen baggrund var oprindeligt i ren matematik og lingvistik, og mange af de andre folk her kommer fra områder som fysik og kemi. Du kan altid vælge op de specifikke værktøjer, du har brug for.)

* Generel programmeringsevne, plus viden om specifikke områder som MapReduce/Hadoop og databaser. For eksempel er et almindeligt mønster for mig, at jeg vil kode et MapReduce-job i Scala, lave noget simpelt kommandolinje-munging på resultaterne, overføre dataene til Python eller R for yderligere analyse, trække fra en database for at få fat i noget ekstra felter og så videre, ofte ved at integrere det, jeg finder, i nogle maskinlæringsmodeller til sidst.

* Webprogrammering, datavisualisering (på storytelling-siden). For eksempel finder jeg det ekstremt nyttigt at kunne smide en hurtig webapp eller et dashboard op, der giver andre mennesker (inklusive mig selv!) mulighed for at interagere med data – når man kommunikerer med både tekniske og ikke-tekniske folk, er en god datavisualisering ofte meget mere nyttigt og indsigtsfuldt end et abstrakt tal.

Selvom der ikke er mange lærebøger eller kurser, der dækker alle tre områder (en undtagelse kan være Jeff Hammerbacher og Mike Franklins kursus i Berkeley: http://datascienc.es/ ), er der naturligvis ressourcer, der dækker hver færdighed alene. (Datavisualisering ser dog ud til at fortsætte med at være en undervurderet færdighed, så klasser på det område er mere sjældne.)

Følg @Mims eller tage kontakt

skjule