Baidus Deep-Learning-system konkurrerer med folk med talegenkendelse

Kinas førende internetsøgningsvirksomhed, Baidu, har udviklet et stemmesystem, der i nogle tilfælde kan genkende engelsk og mandarin tale bedre end mennesker.





Det nye system, kaldet Dyb tale 2 , er især vigtig i forhold til, hvordan den udelukkende er afhængig af maskinlæring til oversættelse. Mens ældre stemmegenkendelsessystemer inkluderer mange håndlavede komponenter for at hjælpe med lydbehandling og transskription, lærte Baidu-systemet at genkende ord fra bunden ved blot at lytte til tusindvis af timers transskriberet lyd.

Teknologien er afhængig af en kraftfuld teknik kendt som deep learning, som involverer træning af et meget stort flerlags virtuelt netværk af neuroner til at genkende mønstre i enorme mængder data. Baidu-appen til smartphones lader brugere søge med stemmen og inkluderer også en stemmestyret personlig assistent kaldet Duer (se Baidu's Duer Joins the Personal Assistant Party). Stemmeforespørgsler er mere populære i Kina, fordi det er mere tidskrævende at indtaste tekst, og fordi nogle mennesker ikke ved, hvordan man bruger Pinyin, det fonetiske system til at transskribere mandarin med latinske tegn.

Historisk set så folk kinesisk og engelsk som to vidt forskellige sprog, og derfor var der behov for at designe meget forskellige funktioner, siger Andrew Ng, en tidligere Stanford-professor og Google-forsker, og nu chefforsker for det kinesiske firma. Læringsalgoritmerne er nu så generelle, at du bare kan lære.



Deep learning har sine rødder i ideer, der først blev udviklet for mere end 50 år siden, men i de sidste par år har nye matematiske teknikker, kombineret med større computerkraft og enorme mængder træningsdata, ført til bemærkelsesværdige fremskridt, især i opgaver, der kræver en eller anden form. visuel eller auditiv perception. Teknikken har allerede forbedret ydeevnen af ​​stemmegenkendelse og billedbehandling, og store virksomheder, herunder Google, Facebook og Baidu, anvender den på de massive datasæt, de ejer.

Deep learning bliver også brugt til stadigt flere opgaver. Facebook bruger for eksempel deep learning til at finde ansigter på de billeder, som dets brugere uploader. Og for nylig har det gjort fremskridt med at bruge dyb læring til at analysere skrevet tekst (se Lære maskiner til at forstå os). Google bruger nu deep learning i mere end 100 forskellige projekter, fra søgning til selvkørende biler.

I 2013 åbnede Baidu sin egen indsats for at udnytte denne nye teknologi, den Deep Learning Institute , samlokaliseret i virksomhedens Beijing-hovedkvarter og i Silicon Valley. Deep Speech 2 blev primært udviklet af et team i Californien.



I udviklingen af ​​Deep Speech 2 skabte Baidu også ny hardwarearkitektur til deep learning, der kører syv gange hurtigere end den tidligere version. Deep learning er normalt afhængig af grafikprocessorer, fordi disse er gode til de involverede intensive parallelle beregninger.

Den opnåede hastighed gjorde det muligt for os at eksperimentere i meget større skala, end folk havde opnået tidligere, siger Jesse Engel , en forsker ved Baidu og en af ​​mere end 30 forskere navngivet på et papir, der beskriver Deep Speech 2. Vi var i stand til at søge over en masse [neuralt netværk]-arkitekturer og reducere ordfejlfrekvensen med 40 procent.

Ng tilføjer, at dette for nylig har givet nogle imponerende resultater. For korte sætninger, ude af kontekst, synes vi at overgå menneskelige niveauer af anerkendelse, siger han.



Han tilføjer: På mandarin er der mange regionale dialekter, der tales af meget mindre befolkninger, så der er meget mindre data. Dette kunne hjælpe os med at genkende dialekterne bedre.

skjule