211service.com
En Google Glass-app ved, hvad du ser på
Google har vist, at kameraet integreret i Google Glass, virksomhedens hovedbårne computer, kan optage nogle slående videoer. Nu maskinlæringsvirksomhed AlchemyAPI har bygget en app, der bruger det kamera til at genkende, hvad en person ser på. Appen blev bygget på en medarbejder-hack-session afholdt af virksomheden i denne måned for at eksperimentere med måder at demonstrere deres nye billedgenkendelsestjeneste på.

At se klart: Denne machine vision-app er 67 procent sikker på, at den ser på et skrivebord (Kredit: AlchemyAPI)
Appen kan enten arbejde på billeder taget af en person, der bærer glas, eller konstant fange billeder fra enhedens kamera. Disse sendes til skyen eller en nærliggende computer til behandling af AlchemyAPIs billedgenkendelsessoftware. Softwaren sender sit bedste bud tilbage på, hvad den ser, og så vil Glass vise, eller tale, dommen.
Der er en lille forsinkelse, og så vil du høre det sige 'lænestol' eller 'bordscomputer', siger AlchemyAPIs administrerende direktør Elliot Turner. Det tager omkring 250 ms at analysere en given frame.
Her er en video af appen i aktion:
Man kan sige, at Turners app blot siger det indlysende, men at gøre det i (næsten) realtid er ingen ringe bedrift for computervisionssoftware. AlchemyAPIs billedgenkendelsessystem er bygget på et system af komplekse simulerede neurale netværk af typen deep learning, som kan producere systemer, der lærer hurtigere og smartere end mere etablerede teknikker. Google har været en pioner på dette område (se Deep Learning) og mange andre store virksomheder inklusive Microsoft (se Microsoft Brings Star Treks Voice Translator til livet) og Facebook (Facebook Launches Advanced AI Research Group) investerer også i teknologien.
An online demo viser mulighederne for AlchemyAPIs billedgenkendelsessoftware. Det viser systemet, der reagerer på et konstant tog af billeder hentet fra Google Billedsøgning og Flickr.
Selvom det er langt fra perfekt, er softwarens ydeevne imponerende. Indsigten, som demoen giver i sikkerheden af hver bedømmelse, den foretager, tyder også på, at den nemt kan få den til at fremstå mere kompetent. Mange af systemets fejl kommer, når det forsøger at være meget specifikt. At sige, at dette er et insekt, ville være bedre, end jeg er ikke sikker på, hvad det er, det kunne være en mantis eller en cricket. Turner siger, at tidlige kunder til billedgenkendelsestilbuddet for det meste er medievirksomheder, der ønsker at kategorisere og søge i store samlinger af umærkede fotografier.
Objektgenkendelsessystemer kan sammenlignes ved at teste dem mod standard ImageNet-databasen, som indeholder mere end 50 millioner billeder mærket med 22.000 forskellige kategorier. Elliot vil ikke dele nøjagtige tal, men siger, at hans system præsterer på niveau med de bedste systemer, der er offentligt testet i forhold til det, som typisk tager omkring 15-17 procent af deres gæt forkerte. Et sådant system driver nu objektgenkendelsen indbygget i Googles billedsøgningsfunktion for dets Google Plus sociale netværk , efter at Google købte en startup grundlagt af deep learning-pioneren Geoffrey Hinton fra University of Toronto år.