211service.com
Maskinlæringsalgoritme identificerer tweets sendt under indflydelse af alkohol
At sende din eks-partner et tårevædet tweet kl. 01.00 efter en flaske chardonnay er ikke nødvendigvis den bedste måde at opnå forsoning på. Vi ved alle, at alkohol og tweeting ikke altid er en god kombination.
Alligevel forkæler et overraskende antal af os denne ejendommelige form for indiskretion. Og denne praksis har givet Nabil Hossain og venner ved University of Rochester en interessant idé.
I dag viser disse fyre, hvordan de har trænet en maskine til at se alkohol-relaterede tweets. Og de viser også, hvordan man bruger disse data til at overvåge alkoholrelateret aktivitet og den måde, den er fordelt i hele samfundet. De siger, at metoden kan have en betydelig indflydelse på den måde, vi forstår og reagerer på de folkesundhedsproblemer, som alkohol og andre aktiviteter rejser.
Hossain og cos arbejde er baseret på to gennembrud. Den første er en måde at træne en maskinlæringsalgoritme til at spotte tweets, der relaterer til alkohol og dem, der er sendt af folk, der drikker alkohol på det tidspunkt. Den anden er en måde at finde en Twitter-brugers hjemsted med meget større nøjagtighed, end det nogensinde har været muligt, og derfor afgøre, om de drikker derhjemme eller ej.
Holdet begyndte med at indsamle geotaggede tweets sendt i løbet af året op til juli 2014 fra New York City og fra Monroe County på den nordlige grænse af staten, som omfatter byen Rochester. Fra dette sæt filtrerer de alle de tweets, der nævner alkohol eller alkohol-relaterede ord, såsom fuld, øl, fest og så videre.
De brugte derefter arbejdere på Amazons Mechanical Turk crowdsourcing-tjeneste til at analysere tweets mere detaljeret. For hvert tweet bad de tre tyrkere om at beslutte, om beskeden omhandlede alkohol, og i givet fald om den henviste til, at tweeteren drak alkohol. Til sidst spurgte de, om tweetet blev sendt på samme tid, som tweeteren indsugede.
Denne proces involverede omkring 11.000 geolokaliserede tweets forbundet med alkohol (selvom detaljer om størrelsen af denne undersøgelse, og derfor dens betydning, desværre mangler i papiret). Det er et stort nok datasæt til at træne en maskinlæringsalgoritme til selv at se alkoholrelaterede tweets.
Det førte dem til det næste spørgsmål - hvor er disse mennesker, når de tweeter om at drikke? Og i særdeleshed, er de hjemme eller et andet sted?
Forskere har udtænkt forskellige metoder til at beregne folks hjemsted ved kun at bruge deres geolokaliserede tweets. Disse inkluderer at vælge det sted, de tweeter fra mest, at vælge det sted, de sender dagens sidste tweet fra, eller det sted, de tweeter fra mellem kl. 01.00 og 06.00. Men alle disse metoder har svagheder, der gør dem svære at stole på. på.
Hossain og co udviklede en anden tilgang. De udarbejdede en liste over ord og sætninger, som folk sandsynligvis vil bruge i tweets sendt fra deres hjem, såsom Endelig hjemme! eller bad, sofa, tv og så videre. De filtrerede geolokaliserede tweets indeholdende disse ord og spurgte tre tyrkere, om de troede, at hvert tweet var sendt hjemmefra eller ej, og beholdt kun dem, som de tre tyrkere alle svarede ja til.
Hossain og co udpegede disse tweets som et jordsandhedsdatasæt for hjemmeplacering og brugte det til at træne en maskinlæringsalgoritme til at identificere andre mønstre forbundet med hjemmebaserede tweets. Algoritmen så for at se, hvordan hjemmeplacering er korreleret med andre indikatorer, såsom placeringen af dagens sidste tweet, den mest populære placering af et tweet, procentdelen af tweets fra et bestemt sted, og så videre.
At stole på flere indikatorer for at bestemme hjemmeplaceringen forbedrer tilgangens nøjagtighed betydeligt sammenlignet med dem, der bruger en enkelt indikator. Faktisk siger Hossain og co, at de kan beregne hjemmeplacering til inden for 100 meter med en nøjagtighed på op til 80 procent. Det er væsentligt bedre end tidligere arbejde.
Sammen gav disse to teknikker holdet mulighed for at finde ud af, hvornår og hvor folk drikker. Og de brugte dette til at sammenligne drikkemønstre i New York City og i forstadsområdet i Monroe county.
Det gør de ved at opdele hvert område i 100 x 100 gitter og markere de områder, hvor der er tweets forbundet med alkohol. Det giver dem mulighed for at udarbejde og sammenligne varmekort over alkoholforbrug for hvert område.
De skelner også tweets om at drikke lavet fra et hjemsted fra dem der er lavet andre steder. Og de kortlægger de forretninger, der sælger alkohol i hvert område. Det giver forskerne mulighed for at undersøge forholdet mellem tætheden af tweets, der sendes fra forskellige regioner, mens de er berusede, og tætheden af alkoholudsalg.
Resultaterne giver interessant læsning. For det første påpeger Hossain og co, at en højere andel af tweets i New York City er forbundet med alkohol end i Monroe County. En mulig forklaring er, at en overfyldt by som NYC med meget tætte alkoholudsalg og mange mennesker, der socialiserer, sandsynligvis vil have en højere andel af drikkeri, siger de.
Desuden afslører geolokationsdataene, at en højere andel af mennesker drikker derhjemme (eller inden for 100 meter fra hjemmet) i New York City end i Monroe County, hvor en høj andel af mennesker drikker længere end en kilometer fra hjemmet.
Varmekortene afslører også interessante mønstre. Det giver holdet mulighed for at komme hjem på 100 x 100 meter gitterpladser, hvor der har været mindst fem tweets om alkohol. Vi mener, at sådanne net er regioner med usædvanlige drikkeaktiviteter, siger Hossain og co.
De fandt også en sammenhæng mellem tætheden af alkoholudsalg i en region og antallet af tweets, der indikerer, at nogen drikker nu. Det rejser et interessant spørgsmål om, hvordan sammenhæng og årsagssammenhæng er forbundet i dette tilfælde. Får en høj tæthed af alkoholudsalg folk til at drikke mere? Eller strømmer drikkende til områder med en høj tæthed af alkoholudsalg? Denne form for data kan naturligvis ikke i sig selv svare på dette.
Men den store kraft ved denne teknik er, at den er billig og hurtig. Derimod er det enormt dyrt og tidskrævende at få et lignende indblik i drikkemønstre på andre måder.
Det vil normalt kræve, at folk bliver nøje udvalgt, at de udfylder forberedte spørgeskemaer og at disse analyseres i detaljer. Maskinlæringstilgangen kunne endda overvåge denne aktivitet i realtid. Vores resultater viser, at tweets kan give kraftfulde og finkornede signaler om aktiviteter, der foregår i byer, siger de.
Der er selvfølgelig forbehold. Der er en klar skævhed i data indsamlet fra Twitter, da unge mennesker og visse minoriteter er overrepræsenteret. Men lignende skævheder er til stede i andre dataindsamlingsmetoder - for eksempel har undersøgelser en tendens til at underrepræsentere folk, der ikke ønsker at udfylde undersøgelser, såsom nogle immigranter. Identifikation og håndtering af skævheder er en vigtig del af alle dataindsamlingsmetoder.
Hossain og co har store planer for deres teknik. Fremover vil de undersøge, hvordan alkoholforbruget varierer med alder, køn, etnicitet og så videre; hvordan forskellige omgivelser påvirker drikke-og-tweeting, såsom venners huse, stadion, park og så videre; og at sammenligne den hastighed, hvormed drikkende strømmer ind og ud af tilstødende kvarterer.
Det sociale aspekt af Twitter vil også være nyttigt. Vi kan udforske det sociale netværk af drikkende for at finde ud af, hvordan sociale interaktioner og gruppepres på sociale medier påvirker tendensen til at referere til drikkeri, siger Hossain og co.
Alt det kunne hjælpe med at informere debatten om de sundhedsrelaterede aspekter af alkohol, som er den tredjestørste årsag til forebyggelige dødsfald i USA. Det er 75.000 dødsfald, som alkohol forårsager hvert år - et tal, der sætter betydningen af dette arbejde i perspektiv sammenlignet med til kærlighedslivets prøvelser og trængsler.
Ref: arxiv.org/abs/1603.03181 : Udledning af fine detaljer om brugeraktiviteter og hjemmeplacering fra sociale medier: Registrering af drikke-mens-tweeting-mønstre i fællesskaber