211service.com
Facebook vil gøre kunstig intelligens bedre ved at bede folk om at bryde den
Yatheesh Gowda / Pixabay
AI's eksplosive succeser i det sidste årti eller deromkring er typisk kridtet op til masser af data og masser af computerkraft. Men benchmarks spiller også en afgørende rolle i at drive fremskridt - test, som forskere kan sætte deres AI op imod for at se, hvor avanceret den er. For eksempel sætter ImageNet, et offentligt datasæt på 14 millioner billeder, et mål for billedgenkendelse. MNIST gjorde det samme for håndskriftsgenkendelse og GLUE (General Language Understanding Evaluation) til behandling af naturligt sprog, hvilket førte til gennembrud sprogmodeller som GPT-3 .
Et fast mål bliver hurtigt overhalet. ImageNet bliver opdateret, og GLUE er blevet erstattet af SuperGLUE, et sæt sværere sproglige opgaver. Alligevel vil forskere før eller siden rapportere, at deres AI har nået overmenneskelige niveauer, og overgået mennesker i denne eller hin udfordring. Og det er et problem, hvis vi vil have benchmarks til at blive ved med at drive fremskridt.
Så Facebook udgiver en ny form for test, der sætter AI'er mod mennesker, der gør deres bedste for at slå dem i stykker. Hedder Dynabench , vil testen være så hård, som folk vælger at lave den.
Benchmarks kan være meget misvisende, siger Douwe Kiela hos Facebook AI Research, der ledede teamet bag værktøjet. At fokusere for meget på benchmarks kan betyde, at man mister bredere mål af syne. Testen kan blive opgaven.
Man ender med et system, der er bedre til testen, end mennesker er, men ikke bedre til den overordnede opgave, siger han. Det er meget bedragerisk, for det får det til at se ud som om, vi er meget længere, end vi faktisk er.
Kiela mener, at det er et særligt problem med NLP lige nu. En sprogmodel som GPT-3 fremstår intelligent, fordi den er så god til at efterligne sprog. Men det er svært at sige, hvor meget disse systemer faktisk forstår.
Tænk på at prøve at måle menneskelig intelligens, siger han. Du kan give folk IQ-tests, men det fortæller dig ikke, om de virkelig forstår et emne. For at gøre det skal du tale med dem, stille spørgsmål.
Dynabench gør noget lignende ved at bruge folk til at udspørge AI'er. Udgivet online i dag, inviterer den folk til at gå til hjemmesiden og quizze modellerne bag. For eksempel kan du give en sprogmodel en Wikipedia-side og derefter stille den spørgsmål og score dens svar.
På nogle måder ligner ideen den måde, folk allerede leger med GPT-3, tester dens grænser, eller den måde, chatbots evalueres til Loebner-prisen, en konkurrence, hvor bots forsøger at bestå som mennesker. Men med Dynabench vil fejl, der opstår under test, automatisk blive ført tilbage til fremtidige modeller, hvilket gør dem bedre hele tiden.
Indtil videre vil Dynabench fokusere på sprogmodeller, fordi de er en af de nemmeste former for kunstig intelligens for mennesker at interagere med. Alle taler et sprog, siger Kiela. Du behøver ikke nogen reel viden om, hvordan man bryder disse modeller.
Men tilgangen bør også fungere for andre typer neurale netværk, såsom tale- eller billedgenkendelsessystemer. Du ville bare have brug for en måde, hvorpå folk kan uploade deres egne billeder - eller få dem til at tegne ting - for at teste det, siger Kiela: Den langsigtede vision for dette er at åbne det op, så alle kan lave deres egen model og begynde at indsamle deres egne data.
Vi ønsker at overbevise AI-samfundet om, at der er en bedre måde at måle fremskridt på, tilføjer han. Forhåbentlig vil det resultere i hurtigere fremskridt og en bedre forståelse af, hvorfor maskinlæringsmodeller stadig fejler.