211service.com
Hvordan Google 'oversætter' billeder til ord ved hjælp af vektorrummatematik
At oversætte et sprog til et andet har altid været en vanskelig opgave. Men i de senere år har Google transformeret denne proces ved at udvikle maskinoversættelsesalgoritmer, der ændrer karakteren af tværkulturel kommunikation gennem Google Translate.
Nu bruger virksomheden den samme maskinlæringsteknik til at oversætte billeder til ord. Resultatet er et system, der automatisk genererer billedtekster, der præcist beskriver indholdet af billeder. Det er noget, der vil være nyttigt for søgemaskiner, til automatiseret publicering og til at hjælpe synshandicappede med at navigere på nettet og faktisk den bredere verden.
Den konventionelle tilgang til sprogoversættelse er en iterativ proces, der starter med at oversætte ord individuelt og derefter omarrangere ordene og sætningerne for at forbedre oversættelsen. Men i de senere år har Google fundet ud af, hvordan man kan bruge sin massive søgedatabase til at oversætte tekst på en helt anden måde.
Fremgangsmåden er i bund og grund at tælle, hvor ofte ord optræder ved siden af eller tæt på andre ord og derefter definere dem i et abstrakt vektorrum i forhold til hinanden. Dette gør det muligt for hvert ord at blive repræsenteret af en vektor i dette rum og sætninger at blive repræsenteret ved kombinationer af vektorer.
Google fortsætter med at gøre en vigtig antagelse. Dette er, at specifikke ord har samme forhold til hinanden uanset sproget. For eksempel bør vektoren konge - mand + kvinde = dronning holde stik på alle sprog.
Det gør sprogoversættelse til et problem med vektorrumsmatematik. Google Translate nærmer sig det ved at omdanne en sætning til en vektor og derefter bruge den vektor til at generere den tilsvarende sætning på et andet sprog.
Nu bruger Oriol Vinyals og venner hos Google en lignende tilgang til at oversætte billeder til ord. Deres teknik er at bruge et neuralt netværk til at studere et datasæt med 100.000 billeder og deres billedtekster og så lære at klassificere indholdet af billeder.
Men i stedet for at producere et sæt ord, der beskriver billedet, producerer deres algoritme en vektor, der repræsenterer forholdet mellem ordene. Denne vektor kan derefter tilsluttes Googles eksisterende oversættelsesalgoritme for at producere en billedtekst på engelsk, eller faktisk på et hvilket som helst andet sprog. Faktisk har Googles maskinlæringstilgang lært at oversætte billeder til ord.
For at teste effektiviteten af denne tilgang brugte de menneskelige evaluatorer rekrutteret fra Amazons Mechanical Turk til at vurdere billedtekster genereret automatisk på denne måde sammen med dem genereret af andre automatiserede tilgange og af mennesker.
Resultaterne viser, at det nye system, som Google kalder Neural Image Caption, klarer sig godt. Ved at bruge et velkendt datasæt af billeder kaldet PASCAL overgik Neural Image Capture klart andre automatiserede tilgange. NIC gav en BLEU-score på 59, der skal sammenlignes med den nuværende state-of-the-art på 25, mens den menneskelige præstation når op på 69, siger Vinyals og co.
Det er ikke dårligt, og tilgangen ser ud til at blive bedre, efterhånden som størrelsen af træningsdatasættene øges. Det er tydeligt fra disse eksperimenter, at efterhånden som størrelsen af de tilgængelige datasæt til billedbeskrivelse stiger, vil ydeevnen af tilgange som NIC også øges, siger Google-teamet.
Det er klart, at dette er endnu en opgave, som dagene med menneskelig overherredømme over maskiner er talte.
Ref: arxiv.org/abs/1411.4555 : Vis og fortæl: En neural billedtekstgenerator