AI-software går op mod fjerdeklasser i naturvidenskabelige tests

I hvilken sæson af året ville en kanins pels være tykkest? Et computerprogram kaldet Aristo kan fortælle dig, fordi det læser om bjørne, der dyrker tykkere skind om vinteren i en studievejledning i fjerde klasse, og det ved, at kaniner også er pattedyr. Det studerer til New York State's standardvidenskabelige eksamener.





Aristo udvikles af forskere ved Allen Institute for Artificial Intelligence i Seattle, som ønsker at give maskiner et mål af sund fornuft om verden. Instituttets administrerende direktør, Oren Etzioni , siger, at den bedste måde at benchmarke udviklingen af ​​deres digitale afkom på er at bruge test designet til skolebørn. Han forsøger at overbevise andre AI-forskere til at vedtage standardiserede skoletests som en måde at måle fremskridt på området.

Vi kan sætte vores forståelse af fremskridt i AI og i naturligt sprog på et objektivt grundlag, siger Etzioni. At være i stand til at sammenligne fordelene ved forskellige tilgange burde gøre det lettere at identificere lovende tilgange og kunne accelerere fremskridt, siger han.

I begyndelsen af ​​oktober vil Allen Institute lancere en konkurrence, der udfordrer forskere til at lave software til at tage sig af ottende klasses naturvidenskabelige spørgsmål. Konkurrencen afholdes på data science-webstedet Kaggle , hvor deltagere vil kunne få adgang til tusindvis af øvelsesspørgsmål for at træne deres software. En præmie på $50.000 vil blive uddelt til skaberen af ​​softwaren, der kan score bedst på spørgsmål, den ikke har set før.



Lige nu er Aristo ikke tæt på at bestå 4. klasses naturfagsprøve. Det kræver en score på 65 procent. Aristo kan kun påtage sig multiple choice-spørgsmålene, som udgør omkring to tredjedele af testen. Det scorer omkring 75 procent på dem, der ikke involverer diagrammer og 45 procent på dem, der gør det, siger Etzioni. Aristo scorer 63 procent på ottende klasses multiple choice-spørgsmål, der udelukker diagrammer.

Du kan se Aristo besvare udvalgte spørgsmål fra fjerde klasse på Allen Institutes hjemmeside. Softwaren bruger begrundelsesalgoritmer til at besvare spørgsmål ved hjælp af viden høstet fra studievejledninger og internettet.

Det er en stor udfordring inden for kunstig intelligens at finde en måde at sætte en smule sund fornuft ind i software, og det kan føre til, at computere hjælper os på mange nye måder. Hvis vi vil bygge systemer, der er robuste og mere naturlige for folk at arbejde med, får de brug for disse evner, siger Etzioni.



Det er en opfattelse, som deles af andre førende forskere, herunder Facebooks ekspanderende AI-laboratorium, som ønsker at muliggøre virtuelle assistenter, der er i stand til grundlæggende samtale (se Teaching Machines to Understand Us). En grund til, at eksisterende virtuelle assistenter som Apples Siri eller Microsofts Cortana er meget begrænsede, er, at de skal klare sig uden sund fornuft. De bruger det du siger til at vælge fra en portefølje af forudprogrammerede regler.

Ernest Davis , en professor ved New York University, er enig i, at en måde at benchmarke en maskines sunde fornuft på kunne hjælpe feltet. Men han mener ikke, at det er et godt valg at bruge skoleprøver.

At bruge test skabt til børn har den fordel, at det sikrer, at forskere ikke ved et uheld eller med vilje gør benchmark for deres felt for let, siger han. Men fordi børn er så meget bedre til at forstå verden end maskiner, kan test skrevet til dem ikke bruges til at undersøge de evner, der er vigtigst for at gøre fremskridt med intelligent software, siger han.



Det, der er svært for mennesker, er meget anderledes end det, der er svært for maskiner, siger Davis, der også arbejder med at give software sund fornuft. Standardiserede test for mennesker får ikke særlig god dækning af den slags problemer, der er svære for computere.

Davis siger, at et bedre alternativ ville være at lave eksamenslignende spørgsmål specifikt til maskiner. Et eksempel på spørgsmål, som han har lavet, tyder på, at en naturvidenskabelig eksamen, der er lavet til maskiner, kunne se meget grundlæggende ud for en fjerde klasse: Sallys yndlingsko døde i går. Koen skal nok være i live igen a) i morgen; b) inden for en uge; c) inden for et år; d) inden for få år; e) koen vil aldrig være i live igen.

Etzioni imødegår, at selvom skoletestspørgsmål ikke direkte tester meget grundlæggende sund fornuft, kræver de det implicit, fordi det er nødvendigt for at fortolke spørgsmålene. Kun ved at bruge spørgsmål, der er lavet til mennesker, kan vi virkelig sige, at vi måler maskiner mod vores egne standarder, siger han. At stille mennesker og maskiner på lige fod giver mening.



skjule