Facebooks AI-system kan tale med Bill Gates stemme

Bill Gates

Bill Gates Jack Taylor / Stringer / Getty





Maskintale er noget af en skuffelse. Selv de bedste tekst-til-tale-systemer har en mekanisk kvalitet og mangler de grundlæggende ændringer i intonation, som mennesker bruger. Stephen Hawkings meget kopierede talesystem er et eksempel på det.

Det er noget af en overraskelse i betragtning af de store fremskridt inden for maskinlæring i de seneste år. De teknikker, der har fungeret så godt til at genkende ansigter og objekter og derefter producere realistiske billeder af dem, burde helt sikkert fungere lige så godt med lyd. Ikke rigtig.

I hvert fald ikke før i dag. Indtast Sean Vasquez og Mike Lewis på Facebook AI Research, som har fundet en måde at overvinde begrænsningerne ved tekst-til-tale-systemer for at producere bemærkelsesværdigt naturtro lydklip, der er genereret udelukkende af maskine. Deres maskine, kaldet MelNet, gengiver ikke kun menneskelig intonation, men kan gøre det med samme stemme som rigtige mennesker. Så holdet trænede det til at tale som Bill Gates, blandt andre. Værket åbner mulighed for mere realistisk interaktion mellem mennesker og computere, men det rejser også spøgelset for en ny æra med falsk lydindhold.



Først lidt baggrund. De langsomme fremskridt med realistiske tekst-til-tale-systemer skyldes ikke mangel på forsøg. Adskillige hold har forsøgt at træne dyb-læringsalgoritmer til at gengive ægte talemønstre ved hjælp af store databaser med lyd.

Problemet med denne tilgang, siger Vasquez og Lewis, er med typen af ​​data. Indtil nu har det meste arbejde fokuseret på lydbølgeformoptagelser. Disse viser, hvordan amplituden af ​​lyd ændrer sig over tid, hvor hvert sekund af optaget lyd består af titusindvis af tidstrin.

Disse bølgeformer viser specifikke mønstre i en række forskellige skalaer. I løbet af et par sekunders tale afspejler bølgeformen for eksempel de karakteristiske mønstre, der er forbundet med ordsekvenser. Men på skalaen af ​​mikrosekunder viser bølgeformen karakteristika forbundet med stemmens tonehøjde og klang. Og på andre skalaer afspejler bølgeformen talerens intonation, fonemstrukturen og så videre.



En anden måde at tænke disse mønstre på er som korrelationer mellem bølgeformen på et tidspunkt og på det næste tidspunkt. Så for en given tidsskala er lyden i begyndelsen af ​​et ord korreleret med de lyde, der følger.

Spektrogram v bølgeform

Dyblæringssystemer burde være gode til at lære disse typer sammenhænge og gengive dem. Problemet er, at korrelationerne virker over mange forskellige tidsskalaer, og deep-learning-systemer kan kun studere sammenhænge over begrænsede tidsskalaer. Det er på grund af en type læringsproces, de anvender, kaldet backpropagation, som gentagne gange omleder netværket for at forbedre dets ydeevne på grundlag af de eksempler, det ser.

Gentagelseshastigheden begrænser tidsskalaen, over hvilken korrelationer kan læres. Så et deep-learning-netværk kan lære korrelationer i lydbølgeformer over lange eller korte tidsskalaer, men ikke begge dele. Det er derfor, de klarer sig så dårligt til at gengive tale.



Vasquez og Lewis har en anden tilgang. I stedet for lydbølgeformer bruger de spektrogrammer til at træne deres dybe læringsnetværk. Spektrogrammer registrerer hele spektret af lydfrekvenser, og hvordan de ændrer sig over tid. Så mens bølgeformer fanger ændringen over tid af en parameter, amplitude, fanger spektrogrammer ændringen over et stort udvalg af forskellige frekvenser.

Dette betyder, at lydinformationen er pakket tættere ind i denne type datarepræsentation. Den tidsmæssige akse af et spektrogram er størrelsesordener mere kompakt end en bølgeform, hvilket betyder, at afhængigheder, der spænder over titusindvis af tidstrin i bølgeformer, kun spænder over hundreder af tidstrin i spektrogrammer, siger Vasquez og Lewis.

Det gør korrelationerne mere tilgængelige for et dybt læringssystem. Dette gør vores spektrogrammodeller i stand til at generere ubetingede tale- og musikprøver med konsistens over flere sekunder, siger de.



Og resultaterne er imponerende. Efter at have trænet systemet ved at bruge almindelig tale fra TED-foredrag, er MelNet derefter i stand til at gengive TED-talerens stemme, der siger mere eller mindre hvad som helst i løbet af få sekunder. Facebook-forskerne demonstrerer sin fleksibilitet ved at bruge Bill Gates' TED-tale til at træne MelNet og derefter bruge sin stemme til at sige en række tilfældige sætninger.

Dette er systemet, der siger Vi rynker panden, når begivenhederne tager en dårlig drejning, og Port er en stærk vin med en røget smag. Andre eksempler er her.

Vi rynker panden, når begivenhederne tager en dårlig drejning

portvin er en stærk vin med en røget smag

Der er selvfølgelig nogle begrænsninger. Almindelig tale indeholder korrelationer over endnu længere tidsskalaer. For eksempel bruger mennesker ændringer i intonation til at angive ændringer i emne eller stemning, efterhånden som historier udvikler sig over ti sekunder eller minutter. Facebooks maskine ser endnu ikke ud til at være i stand til det.

Så selvom MelNet kan skabe bemærkelsesværdigt naturtro sætninger, har teamet endnu ikke perfektioneret længere sætninger, afsnit eller hele historier. Det ser ikke ud til at være et mål, der sandsynligvis snart nås.

Ikke desto mindre kan arbejdet have en betydelig indvirkning på menneske-computer-interaktion. Mange samtaler involverer kun korte sætninger. Især telefonoperatører og helpdeske kan klare sig med en række relativt korte sætninger. Så denne teknologi kunne automatisere disse interaktioner på en måde, der er meget mere menneskelignende end nuværende systemer.

For øjeblikket er Vasquez og Lewis dog fåmælte om potentielle applikationer.

Og som altid er der potentielle problemer med naturligt lydende maskiner, især dem, der kan efterligne mennesker pålideligt. Det kræver ikke megen fantasi at opfinde scenarier, hvor denne teknologi kan bruges til fortræd. Og af den grund er det endnu et AI-relateret fremskridt, der rejser flere etiske spørgsmål, end det besvarer.

Ref: arxiv.org/abs/1906.01083 : MelNet: En generativ model for lyd i frekvensdomænet

skjule