Sådan finder du en social bot på Twitter

Tilbage i 2011 udførte et team fra Texas A&M University et cyberstik for at fange ikke-menneskelige Twitter-brugere, der forurenede Twittersfæren med spam. Deres tilgang var at oprette honeypot-konti, som udsendte useriøst indhold, som ingen menneskelig bruger nogensinde ville være interesseret i. Enhver konto, der retweetede dette indhold, eller venner med ejeren, må helt sikkert være en ikke-menneskelig bruger kendt som en social bot.





Holdet oprettede 60 honningpotter og høstede omkring 36.000 potentielle sociale bot-konti. Resultatet overraskede mange iagttagere på grund af det store antal ikke-menneskelige konti, der var aktive. Disse bots var generelt usofistikerede og retweetede simpelthen mere eller mindre alt indhold, de stødte på.

Siden da er sociale bots blevet væsentligt mere avancerede. De søger på sociale netværk efter populære og indflydelsesrige personer, følger dem og fanger deres opmærksomhed ved at sende dem beskeder. Disse bots kan identificere søgeord og finde indhold i overensstemmelse hermed, og nogle kan endda besvare forespørgsler ved hjælp af naturlige sprogalgoritmer.

Det gør det meget sværere at identificere sociale bots. Men i dag siger Emilio Ferrara og venner ved Indiana University i Bloomington, at de har udviklet en måde at få øje på sofistikerede sociale bots og skelne dem fra almindelige menneskelige brugere.



Teknikken er forholdsvis ligetil. De starter med at samle et sæt sociale bots fra den oprindelige gruppe, der blev udgivet i 2011. De valgte 15.000 af disse og samlede deres 200 seneste tweets samt de 100 seneste tweets, der omtaler dem. Det producerede et datasæt på omkring 2,6 millioner tweets. Holdet samlede derefter et lignende datasæt til 16.000 menneskelige brugere bestående af mere end 3 millioner tweets.

Til sidst skabte forskerne en algoritme kaldet Bot eller ej ? at udvinde disse data på udkig efter væsentlige forskelle mellem egenskaberne for menneskelige brugere og sociale bots. Algoritmen kiggede på over 1.000 funktioner forbundet med disse konti, såsom antallet af tweets og retweets, hver bruger sendte, antallet af svar, omtaler og retweets, hver modtagne, brugernavnets længde og endda kontoens alder.

Det viser sig, at der er betydelige forskelle mellem menneskelige konti og botkonti. Bots har en tendens til at retweete langt oftere end mennesker, og de har også længere brugernavne og yngre konti. I modsætning hertil modtager mennesker flere svar, omtaler og retweets.



Tilsammen skaber disse faktorer en slags fingeraftryk, der kan bruges til at opdage bots. Bot eller ej? opnår meget lovende detektionsnøjagtighed, siger Ferrara og venner.

Der er dog nogle begrænsninger. For det første tog holdet sociale bots, der oprindeligt blev identificeret i 2011, så det er meget muligt, at der nu er mere avancerede bots, der er mindre nemme at opdage.

Og der er også grænsetilfælde, der indeholder indlæg fra både mennesker og sociale bots, for eksempel når mennesker låner deres konti ud til bots, eller når konti er blevet hacket af bots. At opdage disse anomalier er i øjeblikket umuligt, indrømmer Ferrara og co.



Ikke desto mindre er dette en interessant start i processen med at identificere sociale bots. Men det er en opgave, der sandsynligvis bliver sværere, som tiden går. Med kun 140 tegn sætter Twitter betydelige begrænsninger på den type kommunikation, der er mulig. Det er derfor meget lettere for en computer at genskabe den meget begrænsede adfærd, som mennesker udviser i dette rum.

For de interesserede har Ferrara og co lavet deres Bot eller ej? algoritme tilgængelig på denne hjemmeside . Indtast blot skærmnavnet på Twitter-brugeren, og den vil analysere dens funktioner og seneste indlæg for at bestemme sandsynligheden for, at det er en social bot.

Det virkede ikke i skrivende stund, måske offer for en fornærmet social bot. Men hvis det virker nu, så prøv det og skriv dine tanker i kommentarfeltet nedenfor.



Ref: http://arxiv.org/abs/1407.5225 : The Rise of Social Bots

skjule