En fantastisk AI-fremgang gør Googles Smart Butler til at lyde meget bedre

Kategori: Ikke kategoriseret Udsendt 05 okt

Du kan takke DeepMind for den smarte nye stemme, der kommer fra Googles Home-højttaler og Assistant-app.





Denne gang sidste år annoncerede Googles London-baserede AI-afdeling en ny måde at syntetisere tale på. Dens software, kaldet WaveNet, rev den almindelige regelbog for generering af menneskelignende stemmer i stykker: i stedet for at sy klumper af lyd sammen, hvilket ender med at skabe de klodsede robotstemmer, vi er vant til, genererede den en hel lydbølgeform fra bunden, den ene prøve efter den næste. Resultatet var langt jævnere med mere naturlige intonationer end andre talesyntesemetoder.

Men der var et problem: softwaren tog et sekund at generere 0,02 sekunders lyd, hvilket gør den upraktisk til brug i forbrugerprodukter. DeepMind sagde, at det ikke ville blive brugt i nogen af ​​Googles software i nogen tid, hvilket betyder, at de klodsede gammeldags stemmer skulle forblive.

Men i løbet af de sidste 12 måneder har tingene ændret sig. DeepMind nu rapporter at det er lykkedes at fremskynde algoritmen med en faktor på 1.000, så den kan skabe 20 sekunders lyd på et sekunds regnetid. (Det gør den, mens den faktisk skaber lyd med højere kvalitet end den gamle algoritme.) Det er et stort spring, og det har gjort det muligt at køre softwaren på Googles AI-skysystem.



Faktisk er det det, der nu bruges til at skabe al den tale, der udtales af Googles Assistant AI (som i øvrigt, kommer nu i både mandlige og kvindelige versioner ) på telefoner og smarthøjttalere.

Du kan høre et eksempel på gammeldags ikke-WaveNet-talesyntese her og den samme sætning udtalt af den nye, hurtige algoritme her . Forskellen er ret markant.

DeepMind har desværre endnu ikke offentliggjort detaljer om, hvordan det lykkedes at skabe den ultraeffektive version af WaveNet, men den siger, at det planlægger at gøre det i den nærmeste fremtid.