211service.com
AI-assistenter siger dumme ting, og vi er ved at finde ud af hvorfor
Brother UK | Flickr
Siri og Alexa er tydeligvis langt fra perfekte, men der er håb om, at stadige fremskridt inden for maskinlæring vil gøre dem til velformulerede hjælpere inden længe. En ny test kan dog hjælpe med at vise, at der kræves en fundamentalt anderledes tilgang, for at AI-systemer rent faktisk kan mestre sproget.
Udviklet af forskere ved Allen Institute for AI (AI2), en nonprofit med base i Seattle, den AI2 Reasoning Challenge (ARC) vil stille videnskabelige multiple-choice-spørgsmål på grundskoleniveau. Hvert spørgsmål vil kræve en vis forståelse af, hvordan verden fungerer. Projektet er beskrevet i en relateret forskningsartikel (pdf).
Her er et spørgsmål: Hvilken genstand nedenfor er ikke lavet af et materiale, der er dyrket i naturen? (A) en bomuldsskjorte (B) en træstol (C) en plastikske (D) en græskurv
Sådan et spørgsmål er nemt for alle, der ved, at plast ikke er noget, der vokser. Svaret slår ind i et fornuftsbillede af verden, som selv små børn besidder.
Det er denne sunde fornuft, som AI'en bag stemmeassistenter, chatbots og oversættelsessoftware mangler. Og det er en af grundene til, at de er så let forvirrede.
Sprogsystemer, der er afhængige af maskinlæring, kan ofte give overbevisende svar på spørgsmål, hvis de har set mange lignende eksempler før. Et program, der er trænet i mange tusinde it-supportchats, for eksempel, kan måske udgive sig selv som en teknisk supporthjælper i begrænsede situationer. Men sådan et system ville mislykkes, hvis der blev spurgt om noget, der krævede bredere viden.
Vi skal bruge vores sunde fornuft til at udfylde hullerne omkring det sprog, vi ser, for at danne et sammenhængende billede af, hvad der bliver sagt, siger Peter Clark, der er ledende forsker på ARC-projektet. Maskiner har ikke denne sunde fornuft, og ser dermed kun det, der er eksplicit skrevet, og savner de mange implikationer og antagelser, der ligger til grund for et stykke tekst.
Den nye test er en del af et initiativ hos AI2 for at give AI-systemer en sådan forståelse af verden. Og det er vigtigt, fordi det kan være vanskeligt at bestemme, hvor godt et sprogsystem forstår, hvad det siger.
For eksempel udviklede forskere hos Microsoft og en anden gruppe hos Alibaba i januar spørgsmål-og-svar-programmer, der klarede sig bedre end mennesker i en simpel test kaldet Stanford Question Answering Dataset. Disse fremskridt blev ledsaget af overskrifter, der proklamerede, at AI-programmer nu kunne læse bedre end mennesker. Men programmerne kunne ikke besvare mere komplekse spørgsmål eller trække på andre videnskilder.
Teknologivirksomheder vil fortsætte med at fremhæve AI-systemernes muligheder på denne måde. Microsoft annoncerer i dag, at de har udviklet software, der er i stand til at oversætte engelske nyhedshistorier til kinesisk og omvendt, med resultater, som uafhængige frivillige anser for at svare til professionelle oversætteres arbejde. Virksomhedens forskere brugte avancerede deep-learning-teknikker til at nå et nyt niveau af nøjagtighed. Selvom dette potentielt er meget nyttigt, ville systemet kæmpe, hvis det blev bedt om at oversætte fritgående samtale eller tekst fra et ukendt domæne, såsom lægenotater.
Gary Marcus , en professor ved NYU, der har argumenteret for vigtigheden af sund fornuft i AI, er opmuntret af AI2-udfordringen. Jeg tror, det er en god modgift mod den slags overfladiske benchmarks, der er blevet så almindelige inden for maskinlæring, siger han. Det burde virkelig tvinge AI-forskere til at øge deres spil.