En robots ansigt, en engels stemme?

Sidste gang du hørte en computer konvertere en tekstlinje til tale, var den sandsynligvis i krukke. Googles maskinlæringsafdeling, DeepMind, har udviklet et nyt stemmesyntesesystem ved hjælp af kunstig intelligens, som den mener vil forbedre situationen.





At få en computer til at generere lyden af ​​en stemme er ikke en ny idé. Den måske mest almindelige tilgang er simpelthen at bruge et utroligt stort udvalg af forudindspillede talefragmenter fra en enkelt person. I en teknik kaldet sammenkædningssyntese er disse sat sammen for at skabe større lyde, ord og sætninger. Det er derfor, meget computergenereret tale ofte lider af fejl, skæve ændringer i intonation, og udtalen snubler.

Den anden konkurrerende tilgang bruger matematiske modeller til at genskabe kendte lyde, som derefter samles til ord og sætninger. Selvom den er mindre udsat for fejl, ender denne såkaldte parametriske tilgang med at lyde robotisk. Det, der dog forener de to tilgange, er, at de begge syr bidder af lyd sammen i stedet for at skabe hele lydbølgeformen fra bunden.

Det er dog præcis, hvad DeepMinds tilgang gør. WaveNets foldende neurale netværk undervises ved at fodre dem med klip af rigtige menneskelige stemmer og de tilsvarende sproglige og fonetiske træk, så de kan identificere mønstre, der relaterer de to. I brug er systemet forsynet med en ny række af lydfunktioner genereret ud fra en tekstlinje; derefter forsøger den at skabe den rå lydbølge for at repræsentere den fra bunden. Den gør dette trinvist, og genererer først én sample af lydbølgen, så den næste og den næste – ved hvert punkt ved hjælp af information om de samples, som den allerede er oprettet for at hjælpe med at informere en ny.



Resultaterne lyder overbevisende - du kan selv lytte til dem her . Sammenlignet med de sammenkædede og parametriske tilgange er det mærkbart mere menneskelignende.

Der er dog en hage: Teknikken kræver et væld af beregningsmæssige hestekræfter. Da WaveNet skal skabe hele bølgeformen, skal det bruge sine neurale netværksprocesser til at generere 16.000 samples for hvert sekund af lyd, det producerer (og selv da svarer lyden kun til kvaliteten af ​​lyden, der sendes via telefon- eller VoIP-opkald). Ifølge en DeepMind-kilde, der talte med Financial Times (betalingsmur), det betyder, at den ikke vil blive brugt i nogen af ​​Googles produkter indtil videre.

Alligevel er det ikke det eneste sprogproblem, som computere står over for. At tolke tale og det skrevne ord er også notorisk vanskeligt for kunstige intelligenssystemer. I det mindste med denne hastighed, når computere kan mønstre midlerne til at generere virkelig intelligente overvejelser, vil de også være i stand til at kommunikere dem til os med en fremgang.



(Læs mere: DeepMind , Financial Times , AI's sprogproblem)

skjule