Googles hjerne-inspirerede software beskriver, hvad den ser i komplekse billeder

Forskere hos Google har skabt software der kan bruge hele sætninger til nøjagtigt at beskrive scener vist på fotos - et betydeligt fremskridt inden for computersyn. Når der blev vist et billede af et spil ultimativ frisbee, for eksempel, reagerede softwaren med beskrivelsen En gruppe unge mennesker, der spiller et spil frisbee. Softwaren kan endda tælle og giver svar som f.eks. To pizzaer, der sidder på toppen af ​​en komfur.





Eksperimentel software fra Google kan nøjagtigt beskrive scener på billeder, som de to til venstre. Men den laver stadig fejl, som det ses med de to billeder til højre.

Tidligere har de fleste bestræbelser på at skabe software, der forstår billeder, fokuseret på den nemmere opgave at identificere enkelte objekter.

Det er meget spændende, siger Oriol Vinyals , en forsker hos Google. Jeg er sikker på, at der vil komme nogle potentielle applikationer ud af dette.



Den nye software er det seneste produkt af Googles forskning i at bruge store samlinger af simulerede neuroner til at behandle data (se 10 Breakthrough Technologies 2013: Deep Learning). Ingen hos Google har programmeret den nye software med regler for, hvordan scener skal fortolkes. I stedet lærte dets netværk ved at forbruge data. Selvom det kun er et forskningsprojekt for nu, siger Vinyals, er han og andre hos Google allerede begyndt at tænke på, hvordan det kunne bruges til at forbedre billedsøgning eller hjælpe synshandicappede med at navigere online eller i den virkelige verden.

Googles forskere skabte softwaren gennem en slags digital hjernekirurgi, der forbinder to neurale netværk udviklet separat til forskellige opgaver. Et netværk var blevet trænet til at bearbejde billeder til en matematisk repræsentation af deres indhold, som forberedelse til at identificere objekter. Den anden var blevet trænet til at generere fulde engelske sætninger som en del af automatiseret oversættelsessoftware.

Når netværkene kombineres, kan den første se på et billede og derefter føre den matematiske beskrivelse af, hvad den ser, ind i den anden, som bruger denne information til at generere en menneskelig læsbar sætning. Det kombinerede netværk blev trænet til at generere mere nøjagtige beskrivelser ved at vise det titusindvis af billeder med beskrivelser skrevet af mennesker. Vi ser gennem sproget, hvad den troede, billedet var, siger Vinyals.



Efter den træningsproces blev softwaren sat løs på flere store datasæt af billeder fra Flickr og andre kilder og bedt om at beskrive dem. Nøjagtigheden af ​​dens beskrivelser blev derefter bedømt med en automatiseret test, der blev brugt til at benchmarke computer-vision-software. Googles software postede resultater i 60'erne på en 100-punkts skala. Mennesker, der udfører testen, scorer typisk i 70'erne, siger Vinyals.

Dette resultat tyder på, at Google er langt foran andre forskere, der arbejder på at skabe scenebeskrivende software. Stanford-forskere for nylig offentliggjorte detaljer af deres eget system og rapporterede, at det scorede mellem 40 og 50 på den samme standardtest.

Vinyals bemærker dog, at forskere hos Google og andre steder stadig er i de tidlige stadier af at forstå, hvordan man skaber og tester denne form for software. Da Google bad mennesker om at vurdere sin softwares beskrivelser af billeder på en skala fra 1 til 4, var det i gennemsnit kun 2,5, hvilket tyder på, at der stadig er lang vej at gå.



Vinyals forudser, at forskning i forståelse og beskrivelse af scener nu vil intensiveres. Et problem, der kunne bremse tingene: Selvom store databaser med håndmærkede billeder er blevet oprettet for at træne software til at genkende individuelle objekter, er der færre mærkede fotos af mere naturlige scener.

Microsoft lancerede i år en database kaldet KOKOSNØD at prøve at rette op på det. Google brugte COCO i sin nye forskning, men den er stadig relativt lille. Jeg håber, at andre partier vil chip ind og gøre det bedre, siger Vinyals.

skjule