211service.com
Hvordan Google knækkede husnummeridentifikation i Street View
Google Street View er blevet en væsentlig del af online kortlægningsoplevelsen. Det giver brugerne mulighed for at falde ned til gadeniveau for at se lokalområdet i fotografiske detaljer.
Men det er også en nyttig ressource for Google. Virksomheden bruger billederne til at læse husnumre og matche dem til deres geografiske placering. Dette lokaliserer fysisk placeringen af hver bygning i dens database.
Det er især nyttigt på steder, hvor gadenumre ellers er utilgængelige, eller steder som Japan og Sydkorea, hvor gaderne sjældent er nummereret i kronologisk rækkefølge, men på andre måder som den rækkefølge, de blev bygget i, et system der gør mange bygninger umuligt svære at finde, selv for lokalbefolkningen.
Men opgaven med at spotte og identificere disse tal er enormt tidskrævende. Googles street view-kameraer har optaget hundreder af millioner af panoramabilleder, der tilsammen indeholder titusinder af husnumre. Opgaven med at søge i disse billeder manuelt for at finde og identificere numrene er ikke en opgave, som nogen kunne nærme sig med glæde.
Så naturligvis har Google løst problemet ved at automatisere det. Og i dag afslører Ian Goodfellow og venner i virksomheden, hvordan de har gjort det. Deres metode viser sig at stole på et neuralt netværk, der indeholder 11 niveauer af neuroner, som de har trænet til at spotte tal i billeder.
Til at starte med sætter Goodfellow og co nogle begrænsninger for opgaven for at holde den så enkel som muligt. For eksempel antager de, at bygningsnummeret allerede er blevet opdaget, og billedet er beskåret, så tallet er mindst en tredjedel af bredden af den resulterende ramme. De antager også, at tallet ikke er mere end fem cifre langt, en rimelig antagelse i de fleste dele af verden.
Men holdet deler ikke tallet op i enkeltcifrede, som mange andre grupper har gjort. Deres tilgang er at lokalisere hele nummeret i det beskårede billede og identificere det på én gang - alt sammen med et enkelt neuralt netværk.
De træner dette net ved hjælp af billeder tegnet fra et offentligt tilgængeligt datasæt af talbilleder kendt som Street View House Numbers-datasættet. Dette indeholder omkring 200.000 numre taget af Googles Street View-kameraer og gjort offentligt tilgængelige. Uddannelsen tager omkring seks dage at gennemføre, siger de.
Goodfellow og co siger, at det ikke nytter noget i at bruge et automatiseret system, der ikke kan matche eller slå ydeevnen fra menneskelige operatører, som generelt kan spotte tal nøjagtigt 98 procent af tiden. Så dette er holdets mål.
Det betyder dog ikke, at man får øje på 98 procent af tallene i 100 procent af billederne. I stedet siger Goodfellow og co, at det er acceptabelt at få øje på 98 procent af tallene i en bestemt delmængde af billeder, som i dette tilfælde viser sig at dække omkring 95 procent af det samlede antal.
Men selv dette er væsentligt bedre end noget andet hold har været i stand til at opnå. På verdensplan har vi automatisk opdaget og transskriberet tæt på 100 millioner fysiske gadenumre på [menneskeligt] operatørniveau, siger de, og beskriver dette som en hidtil uset succes.
Og de kan gøre det med betydelig hastighed. Vi kan transskribere alle de visninger, vi har af gadenumre i Frankrig, på mindre end en time ved hjælp af vores Google-infrastruktur, siger de. Ja, det er kun en time.
Et interessant spørgsmål er, om den samme teknik kan hjælpe med at udtrække andre numre, såsom telefonnumre på firmaskilte eller endda nummerplader.
Goodfellow og co er dog ikke optimistiske. De siger, at succesen med deres teknik hviler tungt på den antagelse, at gadenumre aldrig er mere end fem cifre. For store [antal cifre] er vores metode usandsynligt at skalere godt, siger de.
Og selvfølgelig er systemet endnu ikke perfekt. At 2 procent af fejlidentificerede tal stadig er en torn i øjet på holdet.
Men i mellemtiden kan Google være forvisset om, at det har taget et væsentligt skridt fremad i karakterudtrækning og genkendelse: lokalisering og identifikation af numre af et enkelt neuralt netværk.
Det store spørgsmål er selvfølgelig, hvad det næste er. Og Goodfellow og co forpligter sig ved at åbne kimonoen kun en brøkdel: Denne tilgang med at bruge et enkelt neuralt netværk som et helt ende-til-ende-system kunne være anvendelig til andre problemer såsom generel teksttransskription eller talegenkendelse.
Så der har du det!
Ref: arxiv.org/abs/1312.6082 : Multicifret nummergenkendelse fra Street View-billeder ved hjælp af Deep Convolutional Neural Networks