For engangsstemmegenkendelse, tag billige chips og tilføj simpel AI

Flickr | msantos7





Pete Warden vil have dig til at smide din stemmegenkendelseshardware i skraldespanden. Og så køb mere – og mere og mere. Denne Google-ingeniør er på en søgen efter at gøre stemmegenkendelse snavs billig.

Hans idé er simpel nok: skær ned på de neurale netværk, der normalt bruges til at behandle lyd, indtil de er effektive nok til at køre på billige, lette chips. Det, jeg vil have, er en 50-cent-chip, der kan lave simpel stemmegenkendelse og køre i et år på et møntbatteri, forklarede han under sidste uges Arm Research Summit i Cambridge, Storbritannien. Vi er der ikke endnu … men jeg tror virkelig, det er kan lade sig gøre med selv den nuværende teknologi, som vi har nu.

Relateret historie

Til en så lav pris ville hardwaren reelt blive engangsbrug, hvilket åbner op for anvendelser, der tidligere har været utænkelige. Enhederne kunne bruges til at bygge billige dukker, der reagerer på dine børn, for eksempel, eller simpel hjemmeelektronik som lamper, der er stemmeaktiverede. Men Warden siger også, at de kunne finde anvendelse i industrielle omgivelser, hvor de lyttede efter lyde i stedet for stemmer – hundredvis af sensorer, der opdager lydsignaturer fra knirkende hjul i fabriksudstyr, eller kvidrende fårekyllinger på en gårdmark.



Warden, der leder teamet hos Google, der udvikler mobile og indlejrede applikationer til firmaets cloud AI-værktøj, kaldet TensorFlow, indser, at han har stillet sig selv en udfordring. Det er ikke muligt at presse den AI ned, der får Amazons AI-assistent, Alexa, til at køre på simple batteridrevne chips med clockhastigheder på kun hundredvis af megahertz. Det er dels fordi Alexa skal fortolke en masse forskellige lyde, men også fordi de fleste stemmegenkendelse AI'er bruger neurale netværk, der er ressourcekrævende, hvorfor Alexa sender sin behandling til skyen.

Så han har begrænset problemet og forsøgt at identificere blot en håndfuld nyttige kommandoer - såsom tænd, sluk, start, stop og så videre. Han har også handlet med almindelige talegenkendelsesalgoritmer. I stedet tager han et lydklip, skærer det op i korte udsnit og beregner derefter frekvensindholdet af hver enkelt. Han stiller hvert af frekvensplottene op efter hinanden for at skabe et 2D-billede af frekvensindhold kontra tid og anvender visuel genkendelsesalgoritmer til at identificere den karakteristiske signatur af en, der siger et enkelt ord.

Holdets første forsøg krævede otte millioner beregninger for at analysere et lydklip på et sekund med 89 procents nøjagtighed. Det kunne køre på en moderne smartphone og være hurtigt nok til at være interaktivt - hvilket er bedre end at skulle sende behandlingen til skyen - men det ville ikke fungere godt på en lavenergi-chip. Efter holdet lånte algoritmiske tricks som hjælper Android-telefoner med at genkende sætningen OK, Google, systemet var i stand til at analysere et sekunds tale med 85 procents nøjagtighed ved at udføre kun 750.000 beregninger.



Holdet har offentliggjort sin kode på TensorFlow-webstedet, som andre kan bruge. I øjeblikket kører den softwaren på chipsene som dem, der bruges i smartphones og Raspberry Pis, den ultrabillige computer-på-et-kort. Det planlægger at forsøge at få dem til at fungere på de mindre chips som dem, der findes i Arduino boards.

Tony Robinson, en tidligere AI-forsker ved Cambridge University, U.K., og nu teknisk chef hos talegenkendelsesfirmaet Speechmatics , siger, at Wardens ambition er god, og mener, at sådanne billige tilgange vil hjælpe med at stemmegenkendelse bliver udbredt i de kommende år. Men han ser et problem med at bygge så begrænsede AI'er. Folk holder sig ikke til manuskriptet, siger han og forklarer, at brugerne næppe vil være tålmodige nok til at gøre brug af et så meget begrænset sæt instruktioner.

I stedet foreslår han, at chips med lidt høj effekt, der kan fremkalde flere af de sproglige muligheder af den slags, der findes i Google Assistant og Amazons Alexa, kan være bedre egnet til forbrugerapplikationer.



skjule