211service.com
Gentag venligst på engelsk
Selvom kvaliteten af computer-renderede oversættelser er forbedret meget i løbet af de sidste 20 år, er nogle resultater stadig lige så grammatisk fjollede som instruktionerne på en spisepindsindpakning. Tag for eksempel en hjemmeside for en Japansk æblefarm der blev konverteret til engelsk ved hjælp af Googles automatisk oversættelsestjeneste :
Someya æblehaven det vil passere meget! Det er plantet i 1954, desuden selv nu, det overstiger træets alder 50 år gammelt velstående, stort - kommer træet unormalt lege alligator æblet er befrugtet. Den velsmagende æble, hvor temperaturforskellen på dag og nat strammet til at være ekstrem Gunma præfektur Numata by, som fire årstider er klare store naturen, hårdt er skabt. *
Ja, det store billede kommer igennem, men meget går tabt af Googles japansk-til-engelsk oversættelsesalgoritme. Google har tilbudt sin oversættelsesfunktion i en årrække, og det samme har den canadisk-baserede internetvirksomhed Babel fisk . For nylig er kommercielle softwareudviklere dog begyndt at udforske oversættelse ud over en statisk webside eller elektronisk dokument og anvender teknologien til real-time internet-instant messaging-samtaler. Tidligere på måneden udgav AvMedia en instant-messaging oversætter designet til at gøre det lettere for engelsktalende at chatte med venner, der taler tysk, spansk, fransk, italiensk og portugisisk, og omvendt (fransk kan også oversættes til tysk og tysk til fransk).
Men al denne software mangler stadig tilstrækkelig nøjagtighed til at være nyttig i krævende situationer, såsom forretningsforhandlinger eller militær planlægning. Dette skyldes sandsynligvis, at det meste kommercielle software følger en traditionel tilgang til maskinoversættelse, siger Kevin Knight, datalog ved University of Southern Californias Informationsvidenskabelige Institut (ISI) og medstifter af det californiske selskab Sprogvæver .
Traditionelt har maskinoversættelsessoftware været afhængig af algoritmer, der sorterer gennem tusindvis af grammatikregler for de to sprog, der skal oversættes, siger Knight. Problemet, forklarer han, er, at så mange regler skal skrives manuelt, ligesom undtagelserne fra disse regler gør, og unøjagtigheden kommer snigende, når komplekse regelsæt modsiger hinanden. Hvis man skriver 5000. reglen, bryder man nogle gange ting, siger Knight.
Med Language Weaver og hans forskning ved USC, griber Knight såvel som en håndfuld andre forskere over hele verden problemet anderledes an. I stedet for at følge stive grammatiske regler matcher Language Weaver korrekte ord og sætninger på tværs af sprog baseret på sandsynligheden for, at sådanne ord og sætninger er korrekte i en given kontekst.
Denne statistiske tilgang trækker fra et stort antal eksempler fra allerede oversatte dokumenter, siger Michael Collins, en computeringeniør ved MIT, som bruger samme metode til en softwareapplikation, han bygger til at udføre tysk-engelsk oversættelser. IBM var banebrydende for denne tilgang i 1990'erne, siger han til dels ved at drage fordel af en enorm database over canadiske parlamentariske sager offentliggjort i både fransk og engelsk version.
Den statistiske variation af maskinoversættelse giver ikke kun bedre resultater end den traditionelle metode, siger Knight, men softwaren er også designet til at fortsætte med at forbedre sig selv. Jo flere oversatte dokumenter softwaren støder på, jo mere sandsynligt vil det matche sætninger korrekt. For et par år siden, for vores kinesiske og arabiske sprog, var alt, hvad vi kunne få, det grundlæggende emne for, hvad en artikel handlede om, siger Knight. Nu er opløsningen på sætningsniveau. [Fortsat på næste side]
-
* Rettelse, 18. januar 2006, 10:00 EST: I den originale version af denne historie citerede vi følgende oversættelse af Someya Apple Farms hjemmeside: Æbleplantagen med store træer over 50 år gamle. Det naturlige miljø omkring Numata, med den enorme temperaturforskel mellem dag og nat, skaber et unikt lækkert æble. Faktisk var dette et uddrag fra Googles oversættelse af æblegårdens egen engelske version af sin hjemmeside, ikke fra Googles oversættelse af den originale japanske side. Derfor var det ikke et gyldigt eksempel på den dårlige kvalitet af nogle maskinoversættelsesalgoritmer. I historien har vi nu erstattet Googles oversættelse af det originale japanske websted. Tak til vores læsere for at påpege fejlen. - Eds.
U.S. Defense Advanced Research Projects Agency (DARPA) er en af de største finansierere af statistisk maskinoversættelse. Sidste august sponsorerede DARPA maskinoversættelsestests for kinesiske og arabiske dokumenter; en forskergruppe fra Google scorede det højeste og rykkede ud af USC's Information Sciences Institute og IBM's maskinoversættelsesarm. Google, som også bruger den statistiske tilgang, kunne have haft en fordel, bemærker Knight, fordi de kunne bruge et stort antal computere til at knaske, og kunne trække fra hele internettet til deres database med foroversatte dokumenter.
I 2005 annoncerede DARPA også programmet Global Autonomous Language Exploitation (GALE), der har til formål at fremskynde computerbehandlingen af et stort antal oversatte dokumenter erhvervet af dets moderprogram, Philadelphia-baserede Lingvistisk datakonsortium .** GALE er i øjeblikket på det første år og vil transskribere tale fra udsendte nyhedskilder og talkshows på arabisk, kinesisk og engelsk, og også katalogisere tekst-newswire-feeds, web-nyhedsdiskussionsgrupper og blogs på disse sprog. Indtil videre er projektet primært fokuseret på dataindsamling fra disse genrer, hvor forskere i computer- og ingeniørvidenskabsafdelingen ved University of Pennsylvania udfører meget af arbejdet.
Men selv med en stor samling af oversat materiale vil der stadig være sproglige problemer at ordne. Det næste trin i maskinoversættelsesforskning, ud over at matche ord og sætninger, er, siger Knight, at udjævne de grammatiske uoverensstemmelser, der opstår, når ord og sætninger kædes sammen. Denne udjævning kan opnås ved at indeksere millioner af sætninger, hvis strukturer er blevet diagrammet ved University of Pennsylvania i 1990'erne (dataene kom fra 50.000 sætninger i Wall Street Journal ). På samme måde som en database fuld af ord og sætninger tillader oversættelsessoftware at vælge den mest statistisk sandsynlige kombination af ord, hjælper disse specifikke eksempler på grammatik fra de diagramformede sætninger softwaren med at tildele sandsynligheden for ordstilling, siger MITs Collins.
Dette er et fremskridt i forhold til den traditionelle metode, hvor grammatikregler blev sat i en algoritme, siger han. I stedet for at adlyde kodede grammatikkonventioner i en algoritme, som med traditionel maskinoversættelse, lader den diagramformede sætningsdatabase softwaren tildele sandsynligheder og vægt på disse regler, siger Collins. [Softwaren] er mere tilbøjelig til at lære konteksten, siger han.
På nogle måder vil den statistiske tilgang dog kun være så god som den almindelige oversætter til onlinemeddelelser. Egennavne for eksempel stadig falder selv den mest læste maskinoversætter i vejret, og de bliver ofte bare oversat sammen med resten af teksten. Ifølge hans system, indrømmer Knight, er den spanske version af hans efternavn stadig Kevin Caballero.
** Rettelse, 20. januar 2006: Den originale version af denne historie, offentliggjort den 18. januar, erklærede, at Linguistic Data Consortium blev lanceret i 2005. Faktisk blev konsortiet lanceret i 1992, og dets Global Autonomous Language Exploitation-projekt blev lanceret i 2005. – Udg.