211service.com
AI-stemmeskuespillere lyder mere menneskelige end nogensinde – og de er klar til at ansætte
Fru Tech | Getty
Virksomhedens blogindlæg drypper af entusiasme fra en amerikansk infomercial fra 90'erne. WellSaid Labs beskriver, hvad kunder kan forvente af deres otte nye digitale stemmeskuespillere! Tobin er energisk og indsigtsfuld. Paige er balanceret og udtryksfuld. Ava er poleret, selvsikker og professionel.
Hver enkelt er baseret på en ægte stemmeskuespiller, hvis lighed (med samtykke) er blevet bevaret ved hjælp af AI. Virksomheder kan nu give disse stemmer licens til at sige, hvad de har brug for. De fører simpelthen noget tekst ind i stemmemotoren, og ud vil spoole et sprødt lydklip af en naturligt klingende præstation.
WellSaid Labs , en Seattle-baseret startup, der er udspringet af forsknings-nonprofitorganisationen Allen Institute of Artificial Intelligence, er det seneste firma, der tilbyder AI-stemmer til kunder. Indtil videre er det specialiseret i stemmer til e-læringsvideoer til virksomheder. Andre startups laver stemmer til digitale assistenter , call center operatører , og endda karakterer fra videospil .
KH · En WellSaid AI stemmeskuespiller i en salgsfremmende stil
For ikke så længe siden havde sådanne dybfalske stemmer noget af et elendigt ry for deres brug i svindelopkald og internet tricky . Men deres forbedrede kvalitet har siden vakt interesse hos et voksende antal virksomheder. Nylige gennembrud inden for dyb læring har gjort det muligt at kopiere mange af finesserne i menneskelig tale. Disse stemmer holder pause og trækker vejret alle de rigtige steder. De kan ændre deres stil eller følelser. Man kan spotte tricket, hvis de taler for længe, men i korte lydklip er nogle blevet umulige at skelne fra mennesker.
AI-stemmer er også billige, skalerbare og nemme at arbejde med. I modsætning til en optagelse af en menneskelig stemmeskuespiller, kan syntetiske stemmer også opdatere deres manuskript i realtid, hvilket åbner op for nye muligheder for at tilpasse annoncering.
Men fremkomsten af hyperrealistiske falske stemmer er ikke konsekvensfri. Især menneskelige stemmeskuespillere er blevet overladt til at undre sig over, hvad det betyder for deres levebrød.
Hvordan man faker en stemme
Syntetiske stemmer har eksisteret i et stykke tid. Men de gamle, inklusive stemmerne fra originalen syrien og Alexa , simpelthen limet ord og lyde sammen for at opnå en klodset, roboteffekt. At få dem til at lyde mere naturlige var en besværlig manuel opgave.
Dyb læring ændrede det. Stemmeudviklere behøvede ikke længere at diktere den nøjagtige pacing, udtale eller intonation af den genererede tale. I stedet kunne de indlæse et par timers lyd i en algoritme og få algoritmen til at lære disse mønstre på egen hånd.
Hvis jeg er Pizza Hut, kan jeg bestemt ikke lyde som Domino's, og jeg kan bestemt ikke lyde som Papa John's.
Rupal Patel, grundlægger og administrerende direktør for VocaliD
Gennem årene har forskere brugt denne grundlæggende idé til at bygge stemmemotorer, der er mere og mere sofistikerede. Den ene WellSaid Labs konstruerede, for eksempel, bruger to primære deep-learning-modeller. Den første forudsiger, ud fra et tekststykke, de brede streger af, hvordan en højttaler vil lyde – inklusive accent, tonehøjde og klang. Den anden udfylder detaljerne, inklusive vejrtrækninger og den måde, stemmen giver genlyd i sit miljø.
At lave en overbevisende syntetisk stemme kræver dog mere end blot at trykke på en knap. En del af det, der gør en menneskelig stemme så menneskelig, er dens inkonsekvens, udtryksfuldhed og evne til at levere de samme linjer i helt forskellige stilarter, afhængigt af konteksten.
At fange disse nuancer involverer at finde de rigtige stemmeskuespillere til at levere de passende træningsdata og finjustere deep-learning-modellerne. WellSaid siger, at processen kræver mindst en time eller to af lyd og et par ugers arbejde for at udvikle en realistisk klingende syntetisk replika.
KH · En Resemble.ai kundeserviceagent KH · En Resemble.ai stemmeskuespiller i konversationsstil
AI-stemmer er blevet særligt populære blandt mærker, der ønsker at opretholde en ensartet lyd i millioner af interaktioner med kunder. Med den allestedsnærværende af smarte højttalere i dag og fremkomsten af automatiserede kundeserviceagenter såvel som digitale assistenter indlejret i biler og smarte enheder, kan mærker blive nødt til at producere op mod hundrede timers lyd om måneden. Men de ønsker heller ikke længere at bruge de generiske stemmer, der tilbydes af traditionel tekst-til-tale-teknologi - en tendens, der accelererede under pandemien, da flere og flere kunder sprang over interaktioner i butikken for at engagere sig virtuelt med virksomheder.
Hvis jeg er Pizza Hut, kan jeg bestemt ikke lyde som Domino's, og jeg kan bestemt ikke lyde som Papa Johns, siger Rupal Patel, professor ved Northeastern University og grundlægger og administrerende direktør for VocaliD, som lover at bygge brugerdefinerede stemmer der matcher en virksomheds brandidentitet. Disse mærker har tænkt over deres farver. De har tænkt over deres skrifttyper. Nu skal de også begynde at tænke på, hvordan deres stemme lyder.
Karen Hao, MIT Tech Review · En VocaliD-annonceprøve med en mandsstemme Karen Hao, MIT Tech Review · En VocaliD-annonceprøve med en kvindestemmeMens virksomheder plejede at skulle hyre forskellige stemmeskuespillere til forskellige markeder – det nordøstlige versus det sydlige USA eller Frankrig versus Mexico – kan nogle stemme-AI-firmaer manipulere accenten eller skifte sprog for en enkelt stemme på forskellige måder. Dette åbner mulighed for at tilpasse annoncer på streamingplatforme afhængigt af, hvem der lytter, og ændrer ikke kun stemmens karakteristika, men også de ord, der bliver sagt. En ølannonce kan bede en lytter om at kigge forbi en anden pub, afhængigt af om den for eksempel spiller i New York eller Toronto. Resemble.ai, som designer stemmer til annoncer og smarte assistenter, siger, at det allerede arbejder med kunder for at lancere sådanne personlige lydannoncer på Spotify og Pandora.
Spil- og underholdningsindustrien ser også fordelene. Sonantic, et firma, der har specialiseret sig i følelsesladede stemmer, der kan grine og græde eller hviske og råbe, arbejder sammen med videospilskabere og animationsstudier for at levere voice-overs til deres karakterer. Mange af dets kunder bruger kun de syntetiserede stemmer i præproduktion og skifter til rigtige stemmeskuespillere til den endelige produktion. Men Sonantic siger, at nogle få er begyndt at bruge dem gennem hele processen, måske for karakterer med færre linjer. Resemble.ai og andre har også arbejdet med film og tv-shows for at lappe skuespillernes præstationer, når ord bliver forvansket eller udtalt forkert.
Men der er begrænsninger for, hvor langt AI kan gå. Det er stadig svært at bevare en stemmes realisme over de lange stræk af tid, der kan være nødvendige for en lydbog eller podcast. Og der er ringe evne til at kontrollere en AI-stemmes præstation på samme måde som en instruktør kan vejlede en menneskelig performer. Vi er stadig i de tidlige dage med syntetisk tale, siger Zohaib Ahmed, grundlægger og administrerende direktør for Resemble.ai, og sammenligner det med de dage, hvor CGI-teknologien blev brugt primært til touch-ups frem for at skabe helt nye verdener fra grønne skærme .
Et menneskeligt præg
Med andre ord forsvinder menneskelige stemmeskuespillere ikke endnu. Ekspressive, kreative og langformede projekter udføres stadig bedst af mennesker. Og for hver syntetisk stemme lavet af disse virksomheder, skal en stemmeskuespiller også levere de originale træningsdata.
Men nogle skuespillere er blevet mere og mere bekymrede for deres levebrød, siger en talsmand hos SAG-AFTRA, fagforeningen, der repræsenterer stemmeskuespillere i USA. Hvis de ikke er bange for at blive automatiseret væk af AI, er de bekymrede for at blive kompenseret uretfærdigt eller miste kontrollen over deres stemmer, som udgør deres brand og omdømme.
Dette er nu genstand for en retssag mod TikTok anlagt af den canadiske stemmeskuespiller Bev Standing, som hævder, at appens indbyggede voice-over-funktion bruger en syntetisk kopi af hendes stemme uden hendes tilladelse. Standings oplevelse afspejler også den af Susan Bennett , den originale stemme fra amerikanske Siri, som blev betalt for hendes første optagelser, men ikke for den fortsatte brug af hendes vokale lighed på millioner af Apple-enheder.
Nogle virksomheder søger at være mere ansvarlige for, hvordan de engagerer sig i stemmeskuespilindustrien. De bedste, siger SAG-AFTRAs rep, har henvendt sig til fagforeningen for at finde ud af den bedste måde at kompensere og respektere stemmeskuespillere for deres arbejde.
Relateret historie
Disse uhyggelige falske mennesker varsler en ny tidsalder inden for AI Har du brug for mere data til dyb læring? Syntetiske datavirksomheder vil gøre det for dig.
Flere bruger nu en overskudsdelingsmodel til at betale skuespillere, hver gang en klient licenserer deres specifikke syntetiske stemme, hvilket har åbnet op for en ny strøm af passiv indkomst. Andre involverer aktørerne i processen med at designe deres AI-lignende og giver dem vetoret over de projekter, det vil blive brugt i. SAG-AFTRA presser også på for lovgivning, der beskytter aktører mod illegitime replikaer af deres stemme.
Men for VocaliDs Patel er pointen med AI-stemmer i sidste ende ikke at replikere menneskelig præstation eller at automatisere eksisterende voice-over-arbejde. I stedet er løftet, at de kan åbne op for helt nye muligheder. Hvad hvis der i fremtiden, siger hun, syntetiske stemmer kunne bruges til hurtigt at tilpasse online undervisningsmateriale til forskellige målgrupper? Hvis du forsøger at nå ud til, lad os sige, en gruppe børn i den indre by, ville det så ikke være fantastisk, hvis den stemme rent faktisk lød, som om den var fra deres samfund?