Maskinlæring er blevet brugt til automatisk at oversætte sprog, der er gået tabt

Oldgræsk indskrevet i sten

Oldgræsk indskrevet i sten Don Lloyd | Flickr





I 1886 stødte den britiske arkæolog Arthur Evans på en gammel sten med et mærkeligt sæt inskriptioner på et ukendt sprog. Stenen kom fra middelhavsøen Kreta, og Evans rejste straks dertil for at gå på jagt efter flere beviser. Han fandt hurtigt adskillige sten og tavler med lignende skrifter og daterede dem fra omkring 1400 fvt.

Lineær B-dechifrering

Det gjorde inskriptionen til en af ​​de tidligste former for skrift, der nogensinde er opdaget. Evans hævdede, at dens lineære form klart var afledt af groft ridsede stregbilleder, der hørte til kunstens spæde barndom, og derved fastslog dens betydning i lingvistikhistorien.

Han og andre fastslog senere, at stenene og tavlerne var skrevet i to forskellige skrifter. Den ældste, kaldet Linear A, stammer fra mellem 1800 og 1400 fvt, hvor øen var domineret af den minoiske civilisation fra bronzealderen.



Det andet skrift, Linear B, er nyere og dukkede først op efter 1400 fvt., da øen blev erobret af mykenere fra det græske fastland.

Evans og andre forsøgte i mange år at tyde de gamle skrifter, men de tabte sprog modstod alle forsøg. Problemet forblev uløst indtil 1953, hvor en amatør-lingvist ved navn Michael Ventris knækkede koden til Linear B.

Hans løsning byggede på to afgørende gennembrud. For det første formodede Ventris, at mange af de gentagne ord i det lineære B-ordforråd var navne på steder på øen Kreta. Det viste sig at være korrekt.



Hans andet gennembrud var at antage, at skriften registrerede en tidlig form for oldgræsk. Den indsigt gav ham straks mulighed for at tyde resten af ​​sproget. I processen viste Ventris, at oldgræsk først dukkede op i skriftlig form mange århundreder tidligere end tidligere antaget.

Ventris' arbejde var en kæmpe præstation. Men det mere ældgamle skrift, Linear A, er forblevet et af de store udestående problemer inden for lingvistik den dag i dag.

Det er ikke svært at forestille sig, at de seneste fremskridt inden for maskinoversættelse kan hjælpe. På få år er studiet af lingvistik blevet revolutioneret af tilgængeligheden af ​​enorme kommenterede databaser og teknikker til at få maskiner til at lære af dem. Maskinoversættelse fra et sprog til et andet er derfor blevet rutine. Og selvom det ikke er perfekt, har disse metoder givet en helt ny måde at tænke sprog på.



Indtast Jiaming Luo og Regina Barzilay fra MIT og Yuan Cao fra Googles AI-laboratorium i Mountain View, Californien. Dette hold har udviklet et maskinlæringssystem, der er i stand til at dechifrere tabte sprog, og de har demonstreret det ved at lade det dechifrere Linear B - første gang dette er blevet gjort automatisk. Den tilgang, de brugte, var meget forskellig fra de almindelige maskinoversættelsesteknikker.

Først lidt baggrund. Den store idé bag maskinoversættelse er forståelsen af, at ord er relateret til hinanden på lignende måder, uanset hvilket sprog der er involveret.

Så processen begynder med at kortlægge disse relationer for et specifikt sprog. Dette kræver enorme databaser af tekst. En maskine søger derefter i denne tekst for at se, hvor ofte hvert ord optræder ved siden af ​​hvert andet ord. Dette mønster af udseende er en unik signatur, der definerer ordet i et multidimensionelt parameterrum. Faktisk kan ordet opfattes som en vektor i dette rum. Og denne vektor fungerer som en kraftig begrænsning for, hvordan ordet kan forekomme i enhver oversættelse, maskinen kommer med.



Disse vektorer adlyder nogle simple matematiske regler. For eksempel: konge – mand + kvinde = dronning. Og en sætning kan opfattes som et sæt vektorer, der følger efter hinanden for at danne en slags bane gennem dette rum.

Den vigtigste indsigt, der muliggør maskinoversættelse, er, at ord på forskellige sprog optager de samme punkter i deres respektive parameterrum. Det gør det muligt at knytte et helt sprog over på et andet sprog med en en-til-en korrespondance.

På denne måde bliver processen med at oversætte sætninger processen med at finde lignende baner gennem disse rum. Maskinen behøver aldrig engang at vide, hvad sætningerne betyder.

Denne proces afhænger i høj grad af de store datasæt. Men for et par år siden viste et tysk team af forskere, hvordan en lignende tilgang med meget mindre databaser kunne hjælpe med at oversætte meget sjældnere sprog, der mangler de store databaser med tekst. Tricket er at finde en anden måde at begrænse den maskinelle tilgang, der ikke er afhængig af databasen.

Nu er Luo og co gået videre for at vise, hvordan maskinoversættelse kan tyde sprog, der er gået helt tabt. Den begrænsning, de bruger, har at gøre med den måde, sprog vides at udvikle sig over tid.

Tanken er, at ethvert sprog kun kan ændre sig på bestemte måder - for eksempel vises symbolerne på relaterede sprog med lignende fordelinger, relaterede ord har samme rækkefølge af tegn, og så videre. Med disse regler, der begrænser maskinen, bliver det meget lettere at tyde et sprog, forudsat at stamsproget er kendt.

Luo og co satte teknikken på prøve med to tabte sprog, Lineær B og Ugaritisk. Sprogforskere ved, at Linear B koder for en tidlig version af oldgræsk, og at Ugaritisk, som blev opdaget i 1929, er en tidlig form for hebraisk.

I betragtning af den information og de begrænsninger, der pålægges af sproglig evolution, er Luo og cos maskine i stand til at oversætte begge sprog med bemærkelsesværdig nøjagtighed. Vi var i stand til korrekt at oversætte 67,3% af lineære B-beslægtede til deres græske ækvivalenter i dechiffreringsscenariet, siger de. Så vidt vi ved, er vores eksperiment det første forsøg på at dechifrere Linear B automatisk.

Det er imponerende arbejde, der tager maskinoversættelse til et nyt niveau. Men det rejser også det interessante spørgsmål om andre tabte sprog - især dem, der aldrig er blevet dechifreret, såsom Linear A.

I dette papir er Lineær A iøjnefaldende ved sit fravær. Luo og co nævner det ikke engang, men det må gøre sig gældende i deres tankegang, som det gør for alle sprogforskere. Alligevel er der stadig brug for betydelige gennembrud, før dette script bliver egnet til maskinoversættelse.

For eksempel ved ingen, hvilket sprog Linear A koder. Forsøg på at tyde det til oldgræsk er alle mislykkedes. Og uden stamsproget fungerer den nye teknik ikke.

Men den store fordel ved maskinbaserede tilgange er, at de hurtigt kan teste det ene sprog efter det andet uden at blive trætte. Så det er meget muligt, at Luo og co kan tackle Linear A med en brute-force-tilgang - prøv blot at dechifrere det til hvert sprog, som maskinoversættelse allerede fungerer for.

Hvis det virker, vil det være en imponerende præstation, som selv Michael Ventris ville blive overrasket over.

Ref: arxiv.org/abs/1906.06718 : Neural dekryptering via minimumsomkostningsflow: fra ugaritisk til lineær B

skjule