211service.com
Sådan bruger du Twitter til mining af personlige data
Din Twitter-stream (og snart din historie med Facebook-vægindlæg) udgør en rig kilde til information om dig, eller, i betragtning af at de fleste tweets er offentlige, næsten alle andre. Det inkluderer alt fra dine talemønstre og de emner, du er besat af, til dine rigtige venners identitet - i det mindste i tweet-o-sfæren. Tricket er at låse den op.
Det første skridt til at komme ind i din underbevidsthed er at downloade et repræsentativt udsnit af dine tweets. Heldigvis gemmer Twitter de sidste 3.200 af dem, hvilket sandsynligvis er flere, end du nogensinde har sprøjtet ud, medmindre du er særlig produktiv.
En nem måde at downloade alle disse tweets på er at tilmelde dig en tjeneste som BackupMy.Net , som vil fange alle tilgængelige tweets (op til den grænse på 3.200) og give dig mulighed for at downloade dem i en række forskellige formater.
Trin to, få dig selv en gratis kopi af TekstWrangler (hvis du er på en Mac) eller dens Windows tilsvarende . Hvis du er på Linux, kan vi eller emacs gøre alt, hvad jeg er ved at beskrive.
Trin tre, start med at filtrere dit korpus af tweets. Tænk på det som en høj af vådt ler. Du kan stille det alle spørgsmål, du har lyst til. Her er hvad jeg spurgte min; hvis du har andre ideer, så skriv dem i kommentarerne.
i) Slet hver anden linje for at eliminere støjen fra alle disse tids- og datostempler. TextWrangler har en kraftfuld Process Lines Containing…-funktion under Tekst-menuen. Det giver dig mulighed for, i dette tilfælde, at slette hver linje, der indeholder strengen +0000, som jeg gætter på er den tomme variabel, hvor geo-placeringsdata normalt ville gå. Hvis dine tweets er geografisk placeret, skal du bare få dem til at søge efter hvert år, hvor du tweetede, forudsat at du ikke ofte slipper år ind i dine tweets.
Det her:
Bliver dette:
Indsæt nu den resulterende tekst i Wordle , ordskygeneratoren, fordi ordskyer bare er smukke måder at visualisere ordfrekvens på.
For en første tilnærmelse er det ikke dårligt - nogle af dine interesser og venner kan ses forsøge at kigge ud omkring skraldord, vi alle bruger på Twitter, som RT
ii) Brug en simpel find og erstat-kommando til at slippe af med RT, via og andre ord, der ikke fortæller dig noget. Nu kan du se, hvad du er besat af. Jeg var tilfældigvis besat af klimaændringer, nyheds buzzwords (nye, nu) og tilsyneladende signalering af sarkasme og ironisk distance ved at begynde sætningsfragmenter med ordet tilsyneladende.
iii) For et renere destillat af dine egne talemønstre og neuroser, brug kommandoen Process Lines Containing... eller dens tilsvarende til at fjerne alle linjer, der er retweets.
iv) Hvis du vil finde ud af, hvem dine rigtige venner er på Twitter (og i mindre grad, hvad du taler med dem om), udtræk alle de linjer, der har et @ i dem.
Hvis du vil vide, hvad du siger, når du taler med dine venner, skal du blot slette hvert ord, der begynder med et @. Eller sorter dokumentet, så du kun kan få fat i alle samtaler, du nogensinde har haft med en bestemt person, og forvandle *det* til en ordsky.
v) Hvis du vil vide, at du taler, når du taler om dig selv, skal du blot udtrække hver linje med den (skifte- og små bogstaver) streng I
Der er utallige værktøjer på nettet til at analysere din twitter-stream, fra frekvensanalyse til følelsesmæssigt indhold , men så vidt jeg ved, er download af alle dine tweets og parsing af dem selv den eneste måde at visualisere deres faktiske indhold med dette niveau af specificitet. Jeg er sikker på, at der er snesevis af forespørgsler, jeg ikke engang har tænkt på, som er mulige med denne metode - du er velkommen til at efterlade dine ideer i kommentarerne.