211service.com
Podcast: AI finder sin stemme
Nutidens stemmeassistenter er stadig langt fra de hyperintelligente tænkemaskiner, vi har tænkt over i årtier. Og det er fordi den teknologi faktisk er kombinationen af tre forskellige færdigheder: talegenkendelse, naturlig sprogbehandling og stemmegenerering.
Hver af disse færdigheder giver allerede store udfordringer. For kun at mestre den naturlige sprogbehandlingsdel? Du er stort set nødt til at genskabe intelligens på menneskeligt niveau. dyb læring, teknologien, der driver det nuværende AI-boom , kan træne maskiner til at blive mestre til alle mulige opgaver. Men den kan kun lære én ad gangen. Og fordi de fleste AI-modeller træner deres færdigheder på tusinder eller millioner af eksisterende eksempler, ender de med at replikere mønstre i historiske data – inklusive de mange dårlige beslutninger, folk har taget, som at marginalisere farvede mennesker og kvinder.
Alligevel har systemer som brætspilsmesteren AlphaZero og den stadig mere overbevisende falske tekstgenerator GPT-3 sat gang i debatten om, hvornår mennesker vil skabe en kunstig generel intelligens -maskiner, der kan multitaske, tænke og ræsonnere for sig selv. I denne episode udforsker vi, hvordan maskiner lærer at kommunikere – og hvad det betyder for menneskene i den anden ende af samtalen.
Vi møder:
- Susan C. Bennett, stemme fra Siri
- Cade Metz, The New York Times
- Charlotte Jee, MIT Technology Review
Credits
Denne episode blev produceret af Jennifer Strong, Emma Cillekens, Anthony Green, Karen Hao og Charlotte Jee. Vi er redigeret af Michael Reilly og Niall Firth.
Afskrift
[TR ID]
Jim: Jeg ved ikke, om det var AI... Hvis de havde taget optagelsen af noget, han havde gjort... og var i stand til at manipulere det... men jeg siger dig, det var min søn.
Stærk: Dagen startede som enhver anden for en mand... vi ringer til Jim. Han bor uden for Boston.
Og forresten... han har et familiemedlem, der arbejder for MIT.
Vi kommer ikke til at bruge hans efternavn, fordi de har bekymringer om deres sikkerhed.
Jim: Det var en tirsdag eller onsdag morgen, klokken ni er jeg dybt i tanker og arbejder på noget,
Stærk: Det vil sige... indtil han modtog dette opkald.
Jim: Telefonen ringer... og jeg tager den op, og det er min søn. Og han er tydeligvis ophidset. Det her barn er en rigtig afslappet fyr, men når han bliver ked af det, har han en række vokale manerer. Og det var ligesom, Åh min Gud, han er i problemer.
Og han fortalte mig dybest set, se, jeg er i fængsel, jeg er i Mexico. De tog min telefon. Jeg har kun 30 sekunder. Øh, de sagde, jeg drak, men det var jeg ikke, og folk er såret. Og se, jeg er nødt til at tage telefonen, ringe til denne advokat, og den giver mig et telefonnummer og skal lægge røret på.
Stærk: Hans søn er i Mexico ... og der er bare ingen tvivl i hans sind ... det er ham.
Jim: Og jeg må fortælle dig, Jennifer, det var ham. Det var hans stemme. Det var alt. Tone. Bare disse små manerer, pauserne, sluken efter luft, alt hvad du kunne forestille dig.
Stærk: Hans hjerte er i halsen...
Jim: Mit hår står på kanten
Stærk: Så han ringer til det telefonnummer... En mand tager op... og han giver flere detaljer om, hvad der foregår.
Jim: Din søn bliver sigtet for at have ramt denne bil. Der kørte en gravid kvinde, hvis arm var brækket. Hendes datter sad på bagsædet.. er i kritisk tilstand, og de er, um, de har anmeldt ham for at køre påvirket. Det tror vi ikke, han har gjort. Det er vi, vi er stødt på det her et antal gange før, men det vigtigste er at få ham ud af fængslet, få ham i sikkerhed, så hurtigt som muligt.
Stærk: Så drejer samtalen sig om penge ... han har fået at vide, at der er sat kaution ... og han er nødt til at sætte ti procent ned.
Jim: Så så snart han begyndte at tale om penge, du ved, flaget gik på en måde op, og jeg sagde, undskyld mig, er der nogen chance for, at dette er en slags fidus? Og han blev virkelig irriteret. Han er ligesom, hej, du ringede til mig. Hør, jeg finder det virkelig stødende, at du beskylder mig for noget. Og så ryger mit hjerte tilbage i halsen. Jeg er ligesom, det er den ene fyr, der er mellem min søn og endnu værre fængsel. Så jeg gik tilbage...
[Musik]
Min kone går ind 10 minutter senere og siger, du ved, jeg skrev en sms med ham sent i går aftes. Ligesom dette er omkring det tidspunkt, han sandsynligvis ville være blevet arresteret og fængslet. Så selvfølgelig skriver vi til ham, han rejser sig bare. Han har det helt fint.
Stærk: Han er stadig ikke sikker på, hvordan nogen fangede essensen af hans søns stemme. Men han har nogle teorier...
Jim: De skulle have fået en optagelse af noget, da han var ked af det. Det er det eneste, jeg kan sige, for de kunne ikke have hånet nogle af de ting, han gør. Det kunne de ikke gætte på. Jeg tror ikke, og så de, jeg tror bestemt, at de havde noget råmateriale at arbejde med, og hvad de så gjorde med det derfra. Jeg ved ikke.
Stærk: Og det er ikke kun Jim, der er usikker... Vi aner ikke, om AI havde noget med dette at gøre.
Men pointen er... vi lever nu i en verden, hvor vi heller ikke kan være sikre på, at den ikke gjorde det.
Det er utroligt nemt at forfalske en persons stemme med blot et par minutters optagelser... og teenagere som Jims søn? De deler utallige optagelser gennem opslag og beskeder på sociale medier.
Jim: Jeg var ret imponeret over hvor god den var. Um, som jeg sagde, jeg er ikke let narre og mand, de havde det sømmet. Så, øh, bare forsigtig.
Stærk: Jeg er Jennifer Strong, og i denne episode ser vi på, hvad der skal til for at lave en stemme.
[VIS ID]
Zeyu Gin: I har lavet mærkelige ting online.
Stærk: Zeyu Jin er forsker hos Adobe... Dette er ham, der taler ved en virksomhedskonference for omkring fem år siden... der viser, hvordan software kan omarrangere ordene i denne optagelse.
Nøgle: Jeg hoppede på sengen og kyssede mine hunde og min kone – i den rækkefølge.
Zeyu: Så hvad med at vi roder med, hvem han rent faktisk kyssede. // Introduktion til Project VoCo. Project VoCo giver dig mulighed for at redigere tale i tekst. Så lad os tage det op. Så jeg indlæser bare dette lydstykke i VoCo. Så som du kan se, har vi lydbølgeformen, og vi har teksten under den. //
Så hvad gør vi? Kopier indsæt. Åh! Ja det er gjort. Lad os lytte til det.
Nøgle: Og jeg kyssede min kone og mine hunde.
Zeyu: Vent der er mere. Vi kan faktisk skrive noget, der ikke er her.
Nøgle: Og jeg kyssede Jordan og mine hunde.
Stærk: Adobe udgav aldrig denne prototype... men den underliggende teknologi bliver ved med at blive bedre.
For eksempel, her er en computergenereret falsk af podcasteren Joe Rogan fra 2019... Den blev produceret af Squares AI-laboratorium kaldet Dessa for at øge bevidstheden om teknologien.
Rogan: 10-7 venner, jeg har noget nyt at fortælle jer alle. Jeg har besluttet at sponsorere et hockeyhold, der udelukkende består af chimpanser.
Stærk: Selvom det lyder som sjov og leg... eksperter advarer om, at disse kunstige stemmer kan gøre nogle typer svindel meget mere almindelige. Ting som det, vi hørte om tidligere.
Mona Sedky: Kommunikationsfokuseret kriminalitet har historisk set ligget lavere på totempælen.
Stærk: Det er den føderale anklager Mona Sedky, der sidste år talte ved Federal Trade Commission om stemmekloningsteknologier.
Mona Sedky: Men nu med fremkomsten af ting som dyb falsk video… nu dyb falsk lyd kan du dybest set have anonymiseringsværktøjer og være hvor som helst på internettet, du ønsker at være…. hvor som helst i verden... og kommuniker anonymt med folk. Så som et resultat har der været en enorm stigning i kommunikationsfokuseret kriminalitet.
Balasubramaniyan: Men tænk, hvis du som CFO eller chief controller får et telefonopkald, der kommer fra din CEOs telefonnummer.
Stærk: Og dette er Pindrop Security CEO Vijay Balasubramaniyan ved en sikkerhedskonference sidste år.
Balasubramaniyan: Det er fuldstændig forfalsket ... så det bruger faktisk din adressebog, og det dukker op som din CEOs navn ... og så på den anden ende hører du din CEOs stemme med en enorm hast. Og vi begynder at se den slags skøre angreb. Der var et eksempel, som en masse pressemedier dækkede, hvilket er en 220.000 dollars ledning, der skete, fordi en administrerende direktør for et britisk firma troede, at han talte med sit moderselskab... så han sendte disse penge ud. Men vi har set så højt som 17 millioner dollars gå ud af døren.
Stærk: Og selve ideen om falske stemmer... kan være lige så skadelig som en falsk stemme i sig selv... Som da tidligere præsident Donald Trump forsøgte at give teknologien skylden for nogle stødende ting, han sagde, som blev fanget på bånd.
Men som enhver anden teknologi ... er det ikke i sig selv godt eller dårligt ... det er bare et værktøj ... og jeg brugte det i traileren til sæson 1 for at vise, hvad teknologien kan.
Stærk: Hvis det at se er at tro...
Hvordan navigerer vi i en verden, hvor vi ikke kan stole på vores øjne ... eller ører?
Og så du ved... hvad du lytter til... Det er ikke kun mig, der taler. Jeg fik lidt hjælp fra en kunstig version af min stemme... ved at udfylde ord her og der.
Mød syntetiske Jennifer.
Syntetisk Jennifer: Hej, folkens!
Stærk: Jeg kan endda klikke for at justere mit humør...
Syntetisk Jennifer: Hej med dig.
Stærk: Ja, lad os ikke gøre den vred..
Stærk: I en ikke så fjern fremtid vil denne teknologi blive brugt på en række forskellige måder... til simple justeringer af forudindspillede præsentationer... endda... for at bringe stemmerne fra animerede karakterer fra en serie tilbage...
Med andre ord er kunstige stemmer kommet for at blive. Men de har ikke altid været så nemme at lave... og jeg ringede til en ekspert, hvis stemme måske lyder bekendt..
Bennett: Hvordan lyder det her? Øh, måske kunne jeg være lidt mere venlig. Hvordan har du det?
Hej, jeg er Susan C. Bennet, den originale stemme af Siri.
Nå, den dag, hvor Siri dukkede op, som var den 4. oktober 2011, sendte en anden stemmeskuespiller mig en e-mail og sagde: 'Hej, vi leger med denne nye iPhone-app, er det ikke dig?' Og jeg sagde, hvad ? Jeg gik ind på Apple-siden og lyttede... og ja. Det var min stemme. [griner]
Stærk: Du hørte det rigtigt. Den originale kvindestemme, som millioner forbinder med Apple-enheder...? Anede ikke. Og hun var ikke alene. De menneskelige stemmer bag andre tidlige stemmeassistenter blev også overrasket.
Bennett: Ja, det har været en interessant ting. Det var en justering i starten, som du kan forestille dig, for det havde jeg ikke forventet. Det var lidt uhyggeligt i starten, jeg bliver nødt til at sige, at jeg aldrig rigtig talte meget til mig selv som Siri, men efterhånden blev jeg accepteret af det, og faktisk endte det med at blive til noget virkelig positivt, så...
Stærk: For at være klar, stjal Apple ikke Susan Bennetts stemme. I årtier har hun lavet stemmearbejde for virksomheder som McDonald's og Delta Airlines ... og år før Siri kom ud ... lavede hun en mærkelig række optagelser, der gav næring til dens udvikling.
Bennett: I 2005 kunne vi ikke have forestillet os noget som Siri eller Alexa. Og så alle os, jeg har talt med andre mennesker, der har haft den samme oplevelse, som har været en virtuel stemme. Du ved, at vi lige troede, at vi kun lavede generisk telefontalebeskeder. Og så da Siri pludselig dukkede op i 2011, er det ligesom, jeg er hvem, hvad, hvad er det her? Så det var en ægte overraskelse, men jeg kan godt lide at tænke på det, da vi lige var på forkant med denne nye teknologi. Så du ved, jeg vælger at tænke på det som en meget positiv ting, selvom vi, ingen af os, nogensinde blev betalt for de millioner og atter millioner af telefoner, som vores stemmer bliver hørt på. Så det er en ulempe.
Stærk: Noget andet, der er akavet... hun siger, at Apple aldrig anerkendte hende som Siris amerikanske stemme... det er på trods af, at hun er blevet en tilfældig berømthed... når millioner af mennesker.
Bennett: Den eneste faktiske anerkendelse, jeg nogensinde har fået, er via Siri. Hvis du spørger Siri 'Hvem er Susan Bennett?' hun vil sige, jeg er Siris originale stemme. Mange tak, Siri. Værdsæt det.
Stærk: Men det er ikke første gang, hun giver sin stemme til en maskine.
Bennett: I slutningen af 70'erne, da de introducerede pengeautomater, kan jeg godt lide at sige, at det var min første oplevelse som en maskine, og du ved, der var ingen personlige computere eller noget på det tidspunkt, og folk stolede ikke på maskiner. De ville ikke bruge pengeautomaterne, fordi de ikke stolede på, at automaterne gav dem de rigtige penge. De, du ved, hvis de lagde penge i maskinen, var de bange for, at de aldrig ville se dem igen. Og så besluttede et meget driftigt reklamebureau i Atlanta på det tidspunkt, McDonald og Little, at menneskeliggøre maskinen. Så de skrev en jingle, og jeg blev stemmen til Tilly, alle tiders fortæller, og så satte de til sidst et lille ansigt på maskinen.
Stærk: Den menneskelige stemme hjælper virksomheder med at opbygge tillid hos forbrugerne...
Bennett: Der er så mange forskellige følelser og betydninger, som vi kommer igennem gennem lyden af vores stemmer i stedet for blot på tryk. Derfor tror jeg, at emojis dukkede op, fordi man ikke kan få nuancerne ind uden stemmen. Og så tror jeg, at det er derfor, stemme er blevet så vigtig en del af teknologien.
Stærk: Og i hendes egen erfaring har interaktioner med denne syntetiske version af hendes stemme fået folk til at stole på og betro sig til hende... at kalde hende en ven, selvom de aldrig har mødt hinanden hende .
Bennett: Nå, jeg synes, at det mærkeligste ved at være Siris stemme for mig er, at da jeg først afslørede mig selv, var det forbløffende for mig, hvor mange mennesker, der betragtede Siri som deres ven eller en slags entitet, som de virkelig kunne relatere til. Jeg tror faktisk, at de i mange tilfælde tænker på hende som et menneske.
Stærk: Det anslås, at det globale marked for stemmeteknologier vil nå op på næsten 185 milliarder dollars i år... og AI-genererede stemmer? er en game changer.
Bennett: Du ved, efter år og år med at arbejde på disse stemmer, er det virkelig, virkelig svært at få den faktiske rytme af den menneskelige stemme. Og jeg er sikker på, at de nok vil gøre det på et tidspunkt, men du vil bemærke selv den dag i dag, du ved, du vil lytte til Siri eller Alexa eller en af de andre, og de vil tale sammen, og det lyder godt indtil det ikke gør. Som, åh, jeg går i butikken. Du ved, der er noget mærkeligt i den rytmiske forstand.
Stærk: Men selv når menneskelignende stemmer bliver almindelige ... hun er ikke helt sikker på, at det vil være en god ting.
Bennett: Men du ved, fordelen for dem er, at de ikke rigtig behøver at komme overens med Siri. De kan bare fortælle Siri, hvad de skal gøre, hvis de ikke kan lide, hvad hun siger, de kan bare slå det fra. Så det er ikke som rigtige menneskelige relationer. Det er måske ligesom, hvad folk gerne vil have, at menneskelige relationer skal være. Alle gør, hvad jeg vil. (latter) Så er alle glade. Ret?
Stærk: Det er stemmeassistenter som Siri og Alexa selvfølgelig ikke lige stemmer. Deres evner kommer også fra AI bag kulisserne.
Det er blevet udforsket i science fiction-film som denne, kaldet Hende … om en mand, der forelsker sig i sin stemmeassistent.
Theodor: Hvordan arbejder du?
Samantha (AI): Tja... Dybest set har jeg intuition. Jeg mener.. DNA'et af, hvem jeg er, er baseret på millioner af personligheder hos alle de programmører, der skrev til mig, men hvad gør mig jeg er min evne til at vokse gennem mine oplevelser. Så dybest set i hvert øjeblik udvikler jeg mig ligesom dig.
Stærk: Men nutidens stemmeassistenter er langt fra de hyperintelligente tænkemaskiner, vi har grublet over i årtier.
Og det er fordi den teknologi... faktisk er mange teknologier. Det er kombinationen af tre forskellige færdigheder ... talegenkendelse, naturlig sprogbehandling og stemmegenerering.
Talegenkendelse er det, der gør det muligt for Siri at genkende de lyde, du laver, og transskribere dem til ord. Naturlig sprogbehandling forvandler disse ord til mening... og finder ud af, hvad de skal sige som svar. Og stemmegenerering er det sidste stykke... det menneskelige element... der giver Siri evnen til at tale.
Hver af disse færdigheder er allerede en kæmpe udfordring... For kun at mestre den naturlige sprogbehandlingsdel? Du er stort set nødt til at genskabe intelligens på menneskeligt niveau.
Og det er vi ikke i nærheden af. Men vi har set bemærkelsesværdige fremskridt med stigningen i dyb læring ... hjælper Siri og Alexa med at være lidt mere nyttige.
Metz: Hvad folk måske ikke ved om Siri er, at den originale teknologi var noget andet.
Stærk: Cade Metz er tech-reporter for New York Times. Hans nye bog hedder Genius Makers: The Mavericks Who Brought AI til Google, Facebook og verden .
Metz: Den måde, som Siri oprindeligt blev bygget på... Man skulle have et team af ingeniører, i et rum, ved deres computere og stykke for stykke, skulle de definere med computerkode, hvordan det ville genkende din stemme.
Stærk: Dengang... ingeniører brugte dage på at skrive detaljerede regler, der skulle vise maskiner, hvordan man genkendte ord og hvad de betyder.
Og dette blev højst gjort grundlæggende niveau ... arbejder ofte med kun stykker stemme ad gangen.
Forestil dig bare alle de forskellige måder, folk kan sige ordet hej på ... eller alle de måder, vi sammensætter sætninger på ... og forklarer hvorfor tiden flyver, eller hvordan nogle verber også kan være navneord.
Metz: Du kan aldrig samle alt, hvad du har brug for, uanset hvor mange ingeniører du har, uanset hvor rig din virksomhed er. At definere hver eneste lille ting, der kan ske, når nogen taler ind i deres iPhone... Du har bare ikke personkraft nok til at bygge alt, hvad du skal bygge. Det er bare for kompliceret.
Stærk: Neurale netværk gjorde den proces meget nemmere... De lærer simpelthen ved at genkende mønstre i data, der føres ind i systemet.
Metz: Du tager den menneskelige tale... Du giver den til det neurale netværk... Og det neurale netværk lærer de mønstre, der definerer menneskelig tale. På den måde kan den genskabe den, uden at ingeniører skal definere hver eneste lille del af den. Det neurale netværk lærer bogstaveligt talt opgaven på egen hånd. Og det er den vigtigste ændring... er, at et neuralt netværk kan lære at genkende, hvordan en kat ser ud, i modsætning til, at folk skal definere for maskinen, hvordan en kat ser ud.
Stærk: Men selv før neurale netværk... Teknikvirksomheder som Microsoft havde til formål at bygge systemer, der kunne forstå den daglige måde, folk skriver og taler på.
Og i 1996 hyrede Microsoft en lingvist ... Chris Brocket ... til at begynde arbejdet med det, de kaldte naturligt sprog AI.
Metz: Fyren er ikke datamatiker, men hans job var at definere den måde, sproget er sat sammen på, ikke sandt. Til en computer. Og det er bare en utrolig svær opgave, ikke? Hvorfor bestiller vi som engelsktalende vores ord, som vi gør, ikke? Og han, han brugte år, bogstaveligt talt år, fem eller seks år hos Microsoft, du ved, langsomt, du ved, og prøvede at fortælle computeren, hvordan engelsk er sat sammen. Så kan computeren gøre det.
Stærk: Så en eftermiddag i 2003... begyndte en lille gruppe hos Microsoft... nede ad gangen fra Brockett... at arbejde på et nyt projekt. De byggede et system, der oversatte sprog ved hjælp af en teknik baseret på statistik.
Ideen er, at hvis et sæt ord på et sprog optrådte med samme frekvens og kontekst i et andet, var det den sandsynlige oversættelse.
Metz: De sammensatte en prototype i løbet af få uger og viste den frem for en gruppe på Microsofts forskningscenter – inklusive Chris Brocket.
Stærk: Systemet er... ret brostensbelagte. Det kun arbejder når det blev anvendt på stykker af en sætning... Og selv dengang... var oversættelserne rodede.
Metz: Da han ser dem demonstrere dette .. får han et panikanfald til det punkt, hvor han bogstaveligt talt tror, han får et hjerteanfald, fordi han indser, at hans karriere måske er slut. At alt, hvad han har brugt de sidste seks år på //, er meningsløst og er blevet gjort meningsløst af det system, som disse fyre byggede i løbet af få uger.
Stærk: På det tidspunkt havde vi ikke den mængde data, der var nødvendig for at træne et neuralt netværk, og heller ikke processorkraften ... men ideen om en sådan har eksisteret siden 1980'erne.
Og en af disse ideer kom i form af NetTalk... som blev udviklet af AI-pioneren Terry Sejnowski.
Systemet kunne lære at tale ord på egen hånd ved at studere børnebøger.
Metz: Terry havde denne utrolige demo, som han ville vise til folk ved konferencer. Det var en slags tidsforskudt, fordi det tog et stykke tid for det neurale netværk at lære, men han kunne vise, at da det begyndte at analysere mønstrene i disse børnebøger, kunne de begynde at pludre...
[Lyde fra NetTalk Demo]
Metz: og så kunne den pludre lidt bedre, og så kunne den begynde at stykke ord sammen, og så kunne den pludselig udtale disse ord.
[Lyde fra NetTalk Demo]
Metz: Han kunne vise sit publikum // med denne demo, hvordan et neuralt netværk kunne lære.
Stærk: Der ville gå yderligere to årtier, før computerkraften eksisterede for virkelig at gøre dette nyttigt.
Metz: Så naturligt sprog var et område, hvor folk selv efter succesen med neurale netværk med tale og billede tænkte: Åh, jamen, det kommer ikke til at fungere med naturligt sprog. Nå, det har den. Det betyder ikke, at det er perfekt.
Stærk: Deep learning (teknologien, der driver den nuværende AI-boom), kan træne maskiner til at blive mestre til alle mulige opgaver. Men den kan kun lære ting én ad gangen. Og fordi de fleste AI-modeller træner deres færdigheder på tusinder eller millioner af eksempler, ender de med at gentage mønstre fundet i gamle data – inklusive de mange dårlige beslutninger, som folk har truffet, som at marginalisere farvede mennesker og kvinder.
Og alle store fremskridt sætter gang i denne debat om, hvornår mennesker vil skabe en kunstig generel intelligens - eller maskiner, der kan multitaske, tænke og ræsonnere for sig selv. For nylig har det været fremskridt som brætspilsmesteren AlphaZero ... og den stadig mere overbevisende falske tekstgenerator GPT-3 ...
Metz: Det kan det, det kan generere blogindlæg. Det kan generere tweets, e-mails. Det kan generere computerprogrammer. Du ved, det virker måske halvdelen af tiden, men når det virker, kan du ikke kende forskel på dets engelsk og dit engelsk. Okay. Det er fremskridt. Det er ikke hjernen, det er ikke engang tæt på, men det er fremskridt.
Stærk: Og disse og andre værktøjer er også... utroligt splittende.
Metz: Kan vi i den nærmeste fremtid bygge et system, der kan alt, hvad den menneskelige hjerne kan. Ret. Og folk vil skændes om dette, som at skumme om munden på begge sider. Virkeligheden er, at vi ikke aner. Ligesom der er mennesker, der er helt sikre på, at det snart vil ske, men de ved ikke, hvad vejen er der. Ingen af os kan forudsige fremtiden. Og det er altså et skænderi om ingenting, der grundlæggende kan afgøres. Så argumentet slutter selvfølgelig aldrig. Du går tilbage til 50'erne, og det er, det er alle de samme ting, ikke?
Stærk: Men hvis vi er for en dag at replikere den intelligens... kunne vi også være i stand til at replikere os selv?
…Det er efter pausen.
[Midroll]
[Musikovergang]
Stærk : Kunstige stemmer har eksisteret i et stykke tid ... men de begyndte ikke at blive mere menneskelignende før virkelig de sidste fem år.
Som da Deepminds tekst-til-tale-algoritme kaldet WaveNet kom på banen ... som er grundlaget for Googles assistent Duplex ... den, der kan booke din håraftale eller restaurantreservation.
[Lyde af Google Duplex, der planlægger en håraftale på brugerens vegne]
*Telefonen ringer*
Stylist: Hej. Hvordan kan jeg hjælpe dig?
AI: Hej. Jeg ringer for at bestille en dameklip til en kunde. Umm... jeg leder efter noget den 3. maj.
Stylist: Jo da. Giv mig et sekund.
Stærk: Siden da har mange andre virksomheder arbejdet på at kommercialisere lignende stemmeteknologier. Lyrebird... Beskriv... Respeecher... bare for at nævne nogle få.
Der er også en række virksomheder, der er gearet til at bevare mindet om vores kære ... ved at skabe interaktive, digitale versioner af dem.
Et firma, kaldet HereAfter, forvandler dem til chatbots, der kan bruges sammen med stemmeassistenter.
Og Tech Review-reporter Charlotte Jee prøvede det af med sine forældre...
Jeee: Alexa, åbn HereAfter.
Syntetisk stemme: Velkommen til HereAfter. Vil du hellere tale med Paul eller med Jane?
Jeee: Jeg vil hellere tale med Jane.
Virtual Jane: Hej, det er Jane Jee, og jeg er glad for at fortælle dig om mit liv.
Jeee: HAHA ÅH MY GUD!
Virtual Jane: Hvordan har du det i dag?
Jeee: Uh, jeg har det godt, tak, mor. Hvordan har du det?
Virtual Jane: Godt.
Stærk: Systemets lytteevner... er ikke de bedste. Du kan kun stille korte, enkle spørgsmål... og du skal vente til systemet er færdig med at tale, før du kan stille et nyt spørgsmål.
Virtual Jane: Der er så meget at tale om. Min barndomskarriere og mine interesser, hvilken af dem lyder bedst?
Jeee: Øh... din barndom.
Virtual Jane: Selvfølgelig. Jeg kom i problemer som barn, fordi jeg var meget selvstændig, og jeg kunne lide at udøve min frihed...
Stærk: Men det du hører nu... er faktisk ikke en falsk eller syntetisk udgave af Charlottes mor. Faktisk er denne oplevelse afhængig af overraskende mindre AI, end du skulle tro.
Hendes forældre blev interviewet i timevis af HereAfter med spørgsmål stillet af Charlotte og hendes søster. Det interview blev derefter redigeret og opdelt i emnesektioner... som kan bringes op og afspilles af systemet baseret på de spørgsmål, de stiller.
Men ... som vi har set ... stemme er kraftfuld. Især når det præsenteres som en interaktiv oplevelse.
Jeee: Åh gud. (latter) Det var så mærkeligt!
Det var som at høre min mor... som en maskine. Det var virkelig vildt.
Jeg følte mig mere følelsesladet ved at lytte til det, end jeg havde forventet? Når stemmen slappede af, og den lød som hende.
Stærk: Dette føles meget som noget, vi har set før. Som i et afsnit af Sort spejl … hvor en kvinde bruger sin partners smartphone-data til at skabe en syntetisk version af hans stemme, efter at han dør.
[Lyder fra Sort spejl - AI gennemsøger delte medier, montage af lydklip fra kvindens afdøde partner]
Stærk: Den søger gennem gamle videoer, tekster, voicemails og indlæg på sociale medier for at bygge et system, der er i stand til at efterligne hans stemme... og personlighed.
AI: Hej?
Kvinde: ...Hej! Du... lyder ligesom ham.
AI: Næsten uhyggeligt, er det ikke? Jeg siger uhyggeligt…. Jeg mener, det er helt vanvittigt, jeg kan endda tale med dig. Jeg mener...jeg har ikke engang en mund.
Kvinde: Det er...Det er bare...
AI: Det er hvad?
Kvinde: Det er lige den slags ting, han ville sige.
AI: Nå... det er derfor, jeg sagde det.
Stærk: Hvilket bringer et vanskeligt problem op... opbygger hun tillid til sin AI-partner... eller fortæller det hende bare, hvad hun vil høre... ?
Og videre hvordan vi kan udvikle stemmeteknologier, der er i stand til sund fornuft eller selvforbedring... ligger endnu et spørgsmål, vi lige er begyndt at rejse... som er... hvordan regner vi med denne nyfundne kraft... til at syntetisere noget så personligt som nogens stemme?
[KREDITTER]
Stærk: Næste afsnit... Vi ser på automatiseringens rolle på vores kredit.
Michele Gilman: Vidnet for staten, som var sygeplejerske, kunne ikke forklare noget om algoritmen. Hun blev bare ved med at gentage igen og igen, at det var internationalt og statistisk valideret, men hun kunne ikke fortælle os, hvordan det fungerede, hvilke data der blev indført i det, hvilke faktorer det vejede, hvordan faktorerne blev vejet. Og så min studerende advokat kigger på mig, og vi kigger på hinanden og tænker, hvordan krydsforsker vi en algoritme...
Stærk: Denne episode blev lavet af mig, Emma Cillekens, Anthony Green, Karen Hao og Charlotte Jee. Vi er redigeret af Michael Reilly og Niall Firth.
Tak fordi du lyttede, jeg er Jennifer Strong.
[TR ID]