211service.com
Blandede sætninger viser, at AI'er stadig ikke rigtig forstår sprog
Fru Tech | Unsplash / Brett Jordan
Mange AI'er, der ser ud til at forstå sprog, og som scorer bedre end mennesker på et almindeligt sæt af forståelsesopgaver, bemærker ikke, når ordene i en sætning er blandet sammen, hvilket viser, at de forstår slet ikke sproget . Problemet ligger i den måde, som NLP-systemer (natursprogbehandling) trænes på; det peger også på en måde at gøre dem bedre på.
Relateret historie
Den måde, vi træner AI på, er grundlæggende fejlbehæftet Processen, der bruges til at bygge de fleste af de maskinlæringsmodeller, vi bruger i dag, kan ikke sige, om de vil fungere i den virkelige verden eller ej - og det er et problem.Forskere ved Auburn University i Alabama og Adobe Research opdagede fejlen da de forsøgte at få et NLP-system til at generere forklaringer på dets adfærd, såsom hvorfor det hævdede, at forskellige sætninger betød det samme. Da de testede deres tilgang, indså de, at det at blande ord i en sætning ikke gjorde nogen forskel for forklaringerne. Dette er et generelt problem for alle NLP-modeller, siger Anh Nguyen ved Auburn University, som har ledet arbejdet.
Holdet så på flere avancerede NLP-systemer baseret på BERT (en sprogmodel udviklet af Google, der understøtter mange af de nyeste systemer, inklusive GPT-3). Alle disse systemer scorer bedre end mennesker på LIM (General Language Understanding Evaluation), et standardsæt af opgaver designet til at teste sprogforståelse, såsom at spotte parafraser, bedømme om en sætning udtrykker positive eller negative følelser og verbale ræsonnementer.
Mand bider hund: De fandt ud af, at disse systemer ikke kunne fortælle, hvornår ord i en sætning var blandet sammen, selv når den nye orden ændrede betydningen. For eksempel opdagede systemerne korrekt, at sætningerne. Giver marihuana kræft? og hvordan kan rygning af marihuana give dig lungekræft? var omskrivninger. Men de var endnu mere sikre på, at Du ryger kræft, hvordan kan marihuana lunge give? og lunge kan give marihuana rygning hvordan du kræft? mente også det samme. Systemerne besluttede også, at sætninger med modsatte betydninger - såsom Forårsager marihuana kræft? og forårsager kræft marihuana? - stillede det samme spørgsmål.
Den eneste opgave, hvor ordstilling betød noget, var en, hvor modellerne skulle kontrollere den grammatiske struktur af en sætning. Ellers ændrede mellem 75 % og 90 % af de testede systemers svar sig ikke, når ordene blev blandet.
Hvad sker der? Modellerne ser ud til at opfange nogle få nøgleord i en sætning, uanset hvilken rækkefølge de kommer i. De forstår ikke sproget, som vi gør, og GLUE – et meget populært benchmark – måler ikke ægte sprogbrug. I mange tilfælde tvinger den opgave en model er trænet i den ikke til at bekymre sig om ordstilling eller syntaks generelt. Med andre ord lærer GLUE NLP-modeller at springe gennem bøjler.
Mange forskere er begyndt at bruge et hårdere sæt af tests kaldet SuperGLUE, men Nguyen formoder, at det vil have lignende problemer.
Dette problem er også blevet identificeret af Yoshua Bengio og kolleger, som fandt det omorganisering af ord i en samtale ændrede nogle gange ikke de svar, chatbots lavede. Og et hold fra Facebook AI Research fandt eksempler på, at dette sker med kinesisk . Nguyens hold viser, at problemet er udbredt.
Betyder det noget? Det afhænger af applikationen. På den ene side ville en AI, der stadig forstår, når du laver en tastefejl eller siger noget forvansket, som et andet menneske kunne, være nyttig. Men generelt er ordrækkefølgen afgørende, når man fjerner en sætnings betydning.
ordne det Hvordan? Den gode nyhed er, at det måske ikke er for svært at rette. Forskerne fandt ud af, at ved at tvinge en model til at fokusere på ordstilling ved at træne den til at udføre en opgave, hvor ordrækkefølgen var vigtig (såsom at opdage grammatiske fejl), fik modellen også til at klare sig bedre på andre opgaver. Dette tyder på, at tilpasning af de opgaver, som modeller er uddannet til at udføre, vil gøre dem generelt bedre.
Nguyens resultater er endnu et eksempel på hvordan modeller kommer ofte langt til kort hvad folk tror, de er i stand til. Han synes, det understreger, hvor svært det er at lave AI'er, der forstår og ræsonnerer som mennesker . Ingen har en anelse, siger han.