Menneskelige oversættere er stadig på toppen – indtil videre

Du er måske gået glip af champagnepropper og bruset af ticker-tape, men i de seneste måneder er computerlingvister begyndt at hævde, at neural maskinoversættelse nu matcher menneskelige oversætteres præstationer.





Teknikken med at bruge et neuralt netværk til at oversætte tekst fra et sprog til et andet er blevet forbedret med stormskridt i de seneste år, takket være de løbende gennembrud inden for maskinlæring og kunstig intelligens. Så det er egentlig ikke en overraskelse, at maskiner har nærmet sig menneskers ydeevne. Faktisk har computerlingvister gode beviser til at understøtte denne påstand.

Men i dag siger Samuel Laubli ved universitetet i Zürich og et par kolleger, at champagnen skal tilbage på is. De bestrider ikke deres kollegers resultater, men siger, at testprotokollen ikke tager hensyn til den måde, mennesker læser hele dokumenter på. Når dette vurderes, halter maskiner væsentligt bagud mennesker, siger de.

Det drejer sig om, hvordan maskinoversættelse skal evalueres. Dette gøres i øjeblikket på to mål: tilstrækkelighed og flydende. En oversættelses tilstrækkelighed bestemmes af professionelle menneskelige oversættere, som læser både originalteksten og oversættelsen for at se, hvor godt den udtrykker kildens betydning. Flydende bedømmes af ensprogede læsere, som kun ser oversættelsen og bestemmer, hvor godt den er udtrykt på engelsk.



Computerlingvister er enige om, at dette system giver nyttige vurderinger. Men ifølge Laubli og co sammenligner den nuværende protokol kun oversættelser på sætningsniveau, hvorimod mennesker også vurderer tekst på dokumentniveau.

Så de har udviklet en ny protokol til at sammenligne ydelsen af ​​maskin- og menneskelige oversættere på dokumentniveau. De bad professionelle oversættere om at vurdere, hvor godt maskiner og mennesker oversatte over 100 nyhedsartikler skrevet på kinesisk til engelsk. Eksaminatorerne vurderede hver oversættelse for fyldestgørende og flydende på sætningsniveau, men afgørende også på niveauet for hele dokumentet.

Resultaterne giver interessant læsning. Til at starte med fandt Laubli og co ingen signifikant forskel i måden professionelle oversættere vurderede tilstrækkeligheden af ​​maskin- og menneskeoversatte sætninger. Ved denne målestok er mennesker og maskiner lige gode oversættere, hvilket er i tråd med tidligere resultater.



Men når det kommer til at evaluere hele dokumentet, vurderes menneskelige oversættelser som mere passende og mere flydende end maskinoversættelser. Menneskelige bedømmere, der vurderer tilstrækkelighed og flydende karakter, viser en stærkere præference for menneskelig oversættelse frem for maskinel oversættelse, når de evaluerer dokumenter sammenlignet med isolerede sætninger, siger de.

Forskerne tror, ​​de ved hvorfor. Vi antager, at evaluering på dokumentniveau afslører fejl såsom fejloversættelser af et tvetydigt ord eller fejl relateret til tekstuel sammenhæng og sammenhæng, som forbliver svære eller umulige at få øje på i en sætningsniveauevaluering, siger de.

For eksempel giver holdet eksemplet med en ny app kaldet 微信挪 车, som mennesker konsekvent oversætter som WeChat Move the Car, men som maskiner ofte oversætter på flere forskellige måder i den samme artikel. Maskiner oversætter denne sætning som Twitter Move Car, WeChat mobile og WeChat Move. Denne form for inkonsekvens, siger Laubli og co, gør dokumenter sværere at følge.



Dette tyder på, at den måde, maskinoversættelse evalueres på, skal udvikle sig væk fra et system, hvor maskiner betragter hver sætning isoleret.

Efterhånden som kvaliteten af ​​maskinoversættelsen forbedres, vil oversættelser blive sværere at skelne med hensyn til kvalitet, og det kan være på tide at skifte i retning af evaluering på dokumentniveau, som giver bedømmerne mere kontekst til at forstå den originale tekst og dens oversættelse, og også afslører oversættelsesfejl relateret til at diskursere fænomener, som forbliver usynlige i en evaluering på sætningsniveau, siger Laubli og co.

Denne ændring skulle hjælpe med at forbedre maskinoversættelsen. Hvilket betyder, at det stadig er indstillet til at overgå menneskelig oversættelse - bare ikke endnu.



Ref: arxiv.org/abs/1808.07048 : Har maskinoversættelse opnået menneskelig paritet? En sag til evaluering på dokumentniveau

skjule