Microsoft bringer Star Treks stemmeoversætter til live

Det kunne være den næstbedste ting at lære et nyt sprog. Microsoft-forskere har demonstreret software, der oversætter talt engelsk til talt kinesisk næsten øjeblikkeligt, samtidig med at den unikke kadence af talerens stemme bevares – et trick, der kunne gøre samtalen mere effektiv og personlig.





Den første offentlige demonstration blev lavet af Rick Rashid , Microsofts forskningschef, den 25. oktober ved et arrangement i Tianjin, Kina. Jeg taler på engelsk, og I vil høre mine ord på kinesisk i min egen stemme, sagde Rashid til publikum. Systemet fungerer ved at genkende en persons ord, hurtigt konvertere teksten til korrekt ordnede kinesiske sætninger og derefter overdrage dem til talesyntesesoftware, der er blevet trænet til at replikere talerens stemme.

Video optaget af publikum har cirkuleret på kinesiske sociale medier siden demonstrationen. Rashid præsenterede demonstrationen for et engelsktalende publikum i en blogindlæg i dag, der inkluderer en video.

Microsoft demonstrerede først teknologi, der ændrer syntetiseret tale, så den matcher en persons stemme tidligere på året (se Software oversætter din stemme til et andet sprog). Men dette system var kun i stand til at læse maskinskrevet tekst. Softwaren kræver cirka en times træning for at kunne syntetisere tale i en persons stemme, hvilket den gør ved at tilpasse en standard tekst-til-tale-model, så den laver visse lyde på samme måde, som højttaleren gør.



AT&T har tidligere vist et liveoversættelsessystem til spansk og engelsk (se AT&T vil sætte din stemme til ansvar for apps), og Google er kendt for at have bygget sine egne eksperimentelle liveoversættere. Imidlertid har prototyperne udviklet af disse virksomheder ikke evnen til at få syntetiseret tale til at matche lyden af ​​en persons stemme.

Microsoft-systemet er en demonstration af virksomhedens nyeste talegenkendelsesteknologi, som er baseret på læringssoftware, der er modelleret på, hvordan netværk af hjerneceller fungerer. I et blogindlæg om demonstrationssystemet siger Rashid, at skiftet til den teknologi har givet mulighed for det største spring i genkendelsesnøjagtighed i årtier. I stedet for at have ét ord ud af fire eller fem forkert, er fejlraten nu ét ord ud af syv eller otte, skrev han.

Microsoft er ikke alene om at se på neurale netværk for at forbedre talegenkendelse. Google begyndte for nylig at bruge sin egen neurale netværksbaserede teknologi i sine stemmegenkendelsesapps og -tjenester (se Google Puts Its Virtual Brain Technology to Work). Ved at anvende denne tilgang opnåede man mellem 20 og 25 procent forbedring i ordfejlfrekvensen, siger Googles ingeniører.



Rashid fortalte MIT Technology Review via e-mail, at han og forskerne ved Microsoft Research Asia, i Beijing, endnu ikke har brugt systemet til at have en samtale med nogen uden for virksomheden, men den offentlige demonstration har vakt stor interesse.

Det, jeg har set, er en eller anden kombination af begejstring, forundring og optimisme om fremtiden, som teknologien kan bringe, siger han.

Rashid siger, at systemet langt fra er perfekt, men bemærker, at det er godt nok til at tillade kommunikation, hvor ingen ellers ville være mulig. Ingeniører, der arbejder på den neurale netværksbaserede tilgang hos Microsoft og Google, er optimistiske, at de kan vride meget mere kraft ud af teknikken, da den kun lige er ved at blive implementeret.



Vi kender endnu ikke grænserne for nøjagtigheden af ​​denne teknologi - den er virkelig for ny, siger Rashid. Efterhånden som vi fortsætter med at 'træne' systemet med flere data, ser det ud til, at det klarer sig bedre og bedre.

skjule