AI har stadig ikke den sunde fornuft til at forstå menneskeligt sprog

Sløret skrift på væggen

Sløret skrift på væggen Pexels / Jimmy Chan





Indtil for ganske nylig var computere håbløse til at producere sætninger, der faktisk gav mening. Men området for natursprogbehandling (NLP) har taget store fremskridt, og maskiner kan nu generere overbevisende passager med et tryk på en knap.

Disse fremskridt er blevet drevet af dyb-læringsteknikker, som udvælger statistiske mønstre i ordbrug og argumentstruktur fra store mængder af tekst. men a nyt papir fra Allen Institute of Artificial Intelligence gør opmærksom på noget, der stadig mangler: Maskiner forstår ikke rigtig, hvad de skriver (eller læser).

Dette er en grundlæggende udfordring i den store forfølgelse af generaliserbar AI - men ud over den akademiske verden er det også relevant for forbrugerne. Chatbots og stemmeassistenter bygget på state-of-the-art naturlige sprogmodeller er for eksempel blevet grænsefladen for mange finansielle institutioner , sundhedsudbydere , og regerings kontorer . Uden en ægte sprogforståelse er disse systemer mere tilbøjelige til at fejle, hvilket forsinker adgangen til vigtige tjenester.



Forskerne byggede på arbejdet med Winograd Schema Challenge , en test oprettet i 2011 for at evaluere den sunde fornuft i NLP-systemer. Udfordringen bruger et sæt af 273 spørgsmål, der involverer par af sætninger, der er identiske bortset fra ét ord. Dette ord, kendt som en trigger, vender betydningen af ​​hver sætnings pronomen, som det ses i eksemplet nedenfor:

  • Trofæet passer ikke ind i den brune kuffert pga det er også stor .
  • Trofæet passer ikke ind i den brune kuffert pga det er også lille .

For at lykkes skal et NLP-system finde ud af, hvilken af ​​to muligheder pronomenet refererer til. I dette tilfælde skal den vælge trofæ til den første og kuffert til den anden for at løse problemet korrekt.

Testen blev oprindeligt designet med den idé, at sådanne problemer ikke kunne besvares uden en dybere forståelse af semantik. State-of-the-art deep-learning-modeller kan nu nå omkring 90% nøjagtighed, så det ser ud til, at NLP er kommet tættere på sit mål. Men i deres papir, som vil modtage Outstanding Paper Award på næste måneds AAAI-konference, udfordrer forskerne effektiviteten af ​​benchmark og dermed niveauet af fremskridt, som feltet faktisk har gjort.



De skabte et betydeligt større datasæt, døbt WinoGrande, med 44.000 af de samme typer problemer. For at gøre det designet de et crowdsourcing-skema til hurtigt at oprette og validere nye sætningspar. (En del af grunden til, at Winograd-datasættet er så lille, er, at det blev håndlavet af eksperter.) Arbejdere på Amazon Mechanical Turk oprettede nye sætninger med påkrævede ord udvalgt gennem en randomiseringsprocedure. Hvert sætningspar blev derefter givet til tre yderligere arbejdere og kun beholdt, hvis det opfyldte tre kriterier: mindst to arbejdere valgte de rigtige svar, alle tre anså mulighederne for utvetydige, og pronomenets referencer kunne ikke udledes gennem simple ordassociationer.

Som et sidste trin kørte forskerne også datasættet gennem en algoritme for at fjerne så mange artefakter som muligt - utilsigtede datamønstre eller korrelationer, der kunne hjælpe en sprogmodel med at nå frem til de rigtige svar af de forkerte årsager. Dette reducerede chancen for, at en model kunne lære at spille datasættet.

Da de testede state-of-the-art modeller på disse nye problemer, faldt ydeevnen til mellem 59,4 % og 79,1 %. Derimod nåede mennesker stadig 94% nøjagtighed. Dette betyder, at en høj score på den originale Winograd-test sandsynligvis er oppustet. Det er bare en datasætspecifik præstation, ikke en generel opgavepræstation, siger Yejin Choi, en lektor ved University of Washington og en senior forskningsleder ved AI2, som ledede forskningen.



Choi håber, at datasættet vil fungere som et nyt benchmark. Men hun håber også, at det vil inspirere flere forskere til at se ud over dyb læring. Resultaterne understregede for hende, at ægte sund fornuft NLP-systemer skal inkorporere andre teknikker, såsom strukturerede vidensmodeller. Hende Tidligere arbejde har vist betydeligt lovende i denne retning. Vi skal på en eller anden måde finde en anden gameplan, siger hun.

Bladet har fået en del kritik. Ernest Davis, en af ​​forskerne, der arbejdede på den originale Winograd-udfordring, siger, at mange af eksempelsætningsparrene, der er opført i papiret, er alvorligt fejlbehæftede med forvirrende grammatik. De svarer ikke til den måde, folk, der taler engelsk, faktisk bruger pronominer, skrev han i en e-mail.

Men Choi bemærker, at virkelig robuste modeller ikke behøver perfekt grammatik for at forstå en sætning. Folk, der taler engelsk som andetsprog, blander nogle gange deres grammatik, men formidler stadig deres betydning.



Mennesker kan nemt forstå, hvad vores spørgsmål handler om og vælge det rigtige svar, siger hun med henvisning til 94 % præstationsnøjagtighed. Hvis mennesker skulle være i stand til det, er min holdning, at maskiner også skal kunne gøre det.

For at få flere historier som denne leveret direkte til din indbakke, tilmeld dig vores Webby-nominerede AI-nyhedsbrev The Algorithm. Det er gratis.

skjule