211service.com
Facebooks nye polyglot AI kan oversætte mellem 100 sprog
Edurne Chopeitia / Unsplash
Nyhederne: Facebook er open source en ny AI-sprogmodel kaldet M2M-100, der kan oversætte mellem et hvilket som helst par blandt 100 sprog. Af de 4.450 mulige sprogkombinationer oversætter den 1.100 af dem direkte. Dette er i modsætning til tidligere flersprogede modeller, som er stærkt afhængige af engelsk som mellemliggende. En oversættelse fra kinesisk til fransk går for eksempel typisk fra kinesisk til engelsk og derefter engelsk til fransk, hvilket øger chancen for at indføre fejl.
Datakurering: Modellen blev trænet på 7,5 milliarder sætningspar. For at kompilere et så stort datasæt, stolede forskerne i høj grad på automatiseret kuration. De brugte webcrawlere til at skrabe milliarder af sætninger fra nettet og fik en anden sprogmodel kaldet FastText til at identificere sproget. (De brugte ingen Facebook-data.) Derefter brugte de et program kaldet LASER 2.0, udviklet tidligere af Facebooks AI-forskningslaboratorium, som bruger uovervåget læring – maskinlæring, der ikke kræver manuelt mærkede data – til at matche sætninger på tværs af sprog ved at deres betydning.
LASER 2.0 skaber, hvad der er kendt som indlejringer fra store, ustrukturerede datasæt af sætninger. Den træner på de tilgængelige sætningseksempler inden for hvert sprog og kortlægger deres forhold til hinanden baseret på, hvor ofte og hvor tæt de bruges. Disse indlejringer hjælper maskinlæringsmodellen med at tilnærme betydningen af hver sætning, som så tillader LASER 2.0 automatisk at parre sætninger, der deler den samme betydning på forskellige sprog.
Parringssprog: Forskerne fokuserede på de sprogkombinationer, som de mente, ville blive mest efterspurgt. De grupperede sprog efter sproglige, geografiske og kulturelle ligheder, med den antagelse, at folk, der bor i samme region, ville kommunikere oftere. Én sproggruppe omfattede for eksempel de mest almindelige sprog, der blev talt i Indien, herunder bengali, hindi, tamil og urdu. LASER 2.0 målrettede derefter sin søgning efter sætningspar på alle de mulige sprogpar inden for hver gruppe.
Løbende udfordringer: Sprog, der tales i steder som Afrika og Sydøstasien, lider stadig af problemer med oversættelseskvalitet, fordi der er for få sprogdata til rådighed til at blive skrabet fra nettet, siger Angela Fan, den ledende forsker på projektet. I betragtning af afhængigheden af webdata skal forskerne også finde ud af teknikker til at identificere og udrydde enhver indlejret sexisme, racisme og andre diskriminerende skævheder. Lige nu har forskerne brugt et bandeordfilter til at rydde op i et særligt grusomt sprog, men det er for det meste begrænset til engelsk.
Kun forskning: Facebook har ingen aktuelle planer om at bruge modellen i sine produkter. M2M-100 er kun beregnet til forskningsformål, siger Fan. I sidste ende er målet dog, at modellen skal forbedre og udvide Facebooks eksisterende oversættelsesmuligheder. Applikationer kan omfatte brugerkommunikation (for eksempel den funktion, der giver folk mulighed for at oversætte indlæg til deres modersmål) og måske indholdsmoderering.