Den ultimative udfordring for anbefalingsmotorer

Sætningen Folk, der købte X, købte også Y, er blevet en af ​​internettidens berømte navne. Denne særlige form for ord kommer fra anbefalingsmotorer, der analyserer de produkter, du tidligere har købt, for at foreslå produkter, du måske kunne lide i fremtiden, normalt baseret på de valg, der er truffet af andre mennesker med lignende smag.





Gode ​​anbefalingsmotorer kan øge salget med flere procent. Derfor er de blevet en af ​​de must-have funktioner til online butikker og tjenester.

Så det er ikke svært at forstå, hvorfor der er stor interesse for at forbedre ydelsen af ​​anbefalede motorer. Faktisk tilbød onlinefilmudbyderen Netflix i 2006 en præmie på 1 million dollars til enhver, der kunne forbedre deres anbefalingsalgoritme med mere end 10 procent. Prisen blev behørigt snappet op kun tre år senere.

Så hvor kan de næste forbedringer komme fra?



I dag får vi et slags svar takket være Amy Zhangs arbejde ved Massachusetts Institute of Technology i Cambridge og et par venner. Disse fyre påpeger, at når det kommer til onlinetjenester såsom filmudbydere, deler flere personer ofte den samme konto. Det betyder, at valget af film og vurderingerne på denne konto er flere forskellige personers kombinerede valg.

Spørgsmålet, de satte sig for at besvare, er, om det er muligt at identificere delte konti blot ved at studere de vurderinger, der er forbundet med det. Og hvis ja, hvordan skal anbefalingerne modificeres som svar?

De begynder med to datasæt af filmanbefalinger. Den første består af over 4 millioner anbefalinger fra 171.000 brugere på over 20.000 film. Dette datasæt har også yderligere oplysninger om husholdningsarrangementer for en undergruppe på 600 brugere. Heraf har 272 husstande to brugere, 14 har tre brugere og fire har fire brugere. Så anbefalingerne fra disse husstande giver en grundlæggende sandhed om delte konti.



Zhang og co har også Netflix-datasættet med vurderinger af næsten 500.000 brugere for over 17.000 film.

De begynder deres analyse med en matematisk behandling af, hvordan man opdeler et fælles sæt vurderinger i dets bestanddele. Opgaven går i bund og grund ud på at finde en række sammenhængende klynger af anbefalinger, der svarer til antallet af personer i husstanden.

I praksis betyder det, at man skal finde klynger af lignende film med lignende vurderinger. En teknik, der viser sig at være vigtig, er, at det er muligt at tildele nogle få film til forskellige brugere med høj selvtillid. For eksempel kan filmene Toy Story, Monsters Inc og Frozen meget vel være blevet set og vurderet af en anden person end en klynge af film, herunder Texas Chainsaw Massacre, Alien og The Exorcist.



I matematik er dette kendt som et subspace clustering problem, og der er flere standardtilgange til at løse det. Zhang og co anvender først disse metoder på de datasæt, hvor husstandene er kendt for at finde ud af, hvilke der fungerer bedst.

De anvendte derefter denne metode på omkring 55.000 brugere i Netflix-databasen, som bedømte mere end 500 film. Deres algoritme mærkede 37.000 af disse som enkeltpersonskonti, 15.000 som 2-personerskonti og 3000 som konti brugt af 3 eller flere personer.

Der er ingen måde at vide om denne opdeling er korrekt, da grundsandhedens information ikke er tilgængelig. Det er dog muligt at studere disse sammensatte regnskaber for at se, om de virker fornuftige. En visuel inspektion af de konti, der blev mærket som sammensatte, giver nogle interessante observationer, siger Zhang og co.



For eksempel fandt de i mange beretninger, at efterfølgere eller sæsoner af det samme tv-program var grupperet sammen. De fandt også ud af, at en bruger ville foretrække film mærket som Science Fiction og Fantasy, mens en anden måske foretrækker film mærket som romantisk. Det ser ud til at give Zhang og co tillid til, at deres algoritme er på rette vej.

Den sidste spørgsmålsadresse er, hvordan man ændrer anbefalinger, når algoritmen har fastslået, at mere end én bruger deler den samme konto. Svaret er ligetil. Du skal blot vise de bedste anbefalinger for hver bruger.

Det er en interessant tilgang, selvom det ikke er klart, hvor meget bedre disse anbefalinger yder i forhold til konventionelle motorer med hensyn til, om de øger salget eller ej. Det er et oplagt mål for fremtidig forskning.

Interessant nok påpeger Zhang og co, at denne tilgang kan tillade en enkelt person at fremstå som et sammensat materiale ved bevidst at inkludere vurderinger på film, som de normalt ikke ville kunne lide. At ændre eller udvide sin ratingprofil til at fremstå som en sammensat bruger, med det formål at sløre for eksempel ens køn, er et interessant forskningsemne, siger de.

Måske vil vi se resultaterne af denne forskning på et tidspunkt i fremtiden.

Ref: arxiv.org/abs/1408.2055 : Gæt hvem der har bedømt denne film: Identifikation af brugere gennem subspace-klynger

skjule