211service.com
Prosodi
Nogle gange er det ikke, hvad du siger, men hvordan du siger det. Det er en sandhed, de fleste mennesker kan relatere til, men det kan computere ikke. Selvom talegenkendelsessoftware er blevet ret god til at forstå ord, kan den stadig ikke skelne tegnsætning som punktum og kommaer, eller vælge mellem tvetydige sætninger, hvis betydning afhænger af talerens følelser. Det er fordi sådan software stadig ikke kan forstå de intonationer, betoninger og pauser - samlet kendt som prosodi - som folk intuitivt bruger til at foretage sådanne skel.
Men med mere end hundrede virksomheds- og akademiske forskningsgrupper, der arbejder på problemet, nyder forsøg på at inkorporere prosodi i talesoftware stigende succes. Prosodi-baserede værktøjer bruges allerede til talesyntese - for at forbedre naturligheden af computerstemmer som dem, der reciterer din banksaldo over telefonen. Efterhånden som prosodiforskningen skrider frem, vil disse automatiserede systemer lyde mere og mere naturlige, selv når de taler komplekse sætninger.
Denne historie var en del af vores juli-udgave 2002
- Se resten af problemet
- Abonner
Det er dog i talegenkendelse, at de mest kritiske fordele bør komme. Nylige fremskridt tyder på, at prosody-software inden for fem år vil udføre opgaver som at fortælle, når en kunde, der taler til et automatiseret telefonsystem, bliver vred og reagere i overensstemmelse hermed - ved for eksempel at overføre opkaldet til et menneske. Det her er virkelig banebrydende ting, siger Michael Picheny, datalog og leder af tale- og sprogalgoritmegruppen hos IBM Research i Yorktown Heights, NY. Indtil de sidste par år var kvaliteten af talegenkendelse så primitiv, at det ikke engang var værd at undersøge, hvordan man kunne fremkalde forskellig adfærd fra maskiner ved at formidle følelsesmæssig hensigt. Først ville du bare have maskinen til at få ordene rigtige.
Lydbølger har tre grundlæggende komponenter, som prosody-software kan arbejde med. Den første er timing - varigheden af pauser mellem ord og sætninger. For det andet kommer tonehøjden - mere præcist, den relative ændring i tonehøjden inden for ord og sætninger. Til sidst er der volumen - en amplitudeændring, der indikerer betoning.
Det er meget sværere for en computer at få betydning fra disse funktioner end at identificere ord, siger Elizabeth Shriberg, en computerforsker, der leder prosodiforskning ved SRI International i Menlo Park, CA. Ord er en lineær række af fonetiske begivenheder, såsom ee og th. Prosodiske træk forekommer derimod på tværs af ord og sætninger. Hvad værre er, forskellige slags prosodiske mønstre overlapper ofte hinanden; et sæt kunne afsløre, at en sætning blev sagt roligt, et andet, at sætningen var et spørgsmål. Men forskere begynder at kortlægge dem. For eksempel har Shriberg og hendes kolleger lavet en skabelon af en vred sætning: den er langsommere generelt, har en overdrevet vægt på nøgleord og ender med en nedadgående vending i tonehøjden (jeg havde brug for dette sidste tirsdag men den er ikke kommet). Shriberg har genereret prosodiske modeller af alt fra forskellige følelsesmæssige tilstande til tegnsætning til disfluencies-skift, når folk skifter tanker midt i sætningen eller mumler øh.
Mens SRI's værktøjer stadig er forskningsøvelser, kan bred skala brug af prosodi til talegenkendelse være lige over horisonten. Begrænsede applikationer bruges allerede i kinesisk talegenkendelsessoftware. I Kina kan ordet Ma, afhængigt af bøjning, betyde mor eller hest eller indikere, at sætningen var en forbandelse, forklarer Xuedong Huang, en datalog, der leder en taleteknologigruppe hos Microsoft Research i Redmond, WA. Det er meget farligt, joker han. Microsoft er allerede begyndt at inkorporere simpel prosodi i deres kinesisk sproglige talegenkendelsessoftware og arbejder på at skabe næste generations software til kinesiske og japanske sprog.
De næste fem år bør se engelsksprogede prosodiske værktøjer til talegenkendelse gøre deres første markedsindtog. Én applikation: Virksomheder kunne automatisk søge i registrerede kundeservicetelefondatabaser, finde de vrede opkald og studere, hvad der gik galt. En anden mulighed: at identificere tegnsætning, så læger, der taler ind i dikteringssystemer, ikke behøver at sige punktum.
Men det vil tage mindst ti år, siger SRIs Shriberg, før enhver computer kan begynde at gøre, hvad folk gør hver dag - fuldstændig afkode en samtale med al dens bøjning, mens den filtrerer baggrundsstøj fra. Vi forsøger at lukke [mand-maskine] kløften noget, så når mennesker er en mangelvare, eller i rummet eller på livsstøtte, vil computeren være så smart som muligt, siger Shriberg. For nu skal du i hvert fald ikke prøve at forklare den ambition til en computer. Det vil ikke forstå din begejstring.
