Et computerprogram, der lærer at forestille sig verden, viser, hvordan AI kan tænke mere som os

DeepMinds fremmarch kan føre til maskiner, der kan give bedre mening om en scene. 14. juni 2018

Deepmind





Maskiner bliver nødt til at blive meget bedre til at forstå verden på egen hånd, hvis de nogensinde skal blive virkelig intelligente.

DeepMind , det AI-fokuserede datterselskab af Alphabet, har taget et skridt i den retning ved at lave et computerprogram, der bygger et mentalt billede af verden helt af sig selv. Man kan sige, at den lærer at forestille sig verden omkring den.

Systemet, som bruger det, DeepMinds forskere kalder et generativt forespørgselsnetværk (GQN), ser på en scene fra flere vinkler og kan derefter beskrive, hvordan den ville se ud fra en anden vinkel.



Dette kan virke trivielt, men det kræver en relativt sofistikeret evne til at lære om den fysiske verden. I modsætning til mange AI vision-systemer giver DeepMind-programmet mening med en scene mere, som en person gør. Selvom noget for eksempel er delvist okkluderet, kan det ræsonnere om, hvad der er der.

I sidste ende kan en sådan teknologi være med til at tjene som grundlaget for dybere kunstig intelligens, og lade maskiner beskrive og ræsonnere om verden med meget større sofistikering.

Ali Eslami, en forsker ved DeepMind, og hans kolleger testede tilgangen på tre virtuelle indstillinger: en bloklignende bordplade, en virtuel robotarm og en simpel labyrint. Systemet bruger to neurale netværk; man lærer og en anden genererer eller forestiller sig nye perspektiver. Systemet fanger aspekter af en scene, herunder objektformer, positioner og farver, ved hjælp af en vektorrepræsentation, hvilket gør det relativt effektivt. Forskningen vises i tidsskriftet Videnskab i dag.



Værket er noget af en ny retning for DeepMind, som har skabt sit navn ved at udvikle programmer, der er i stand til at udføre bemærkelsesværdige bedrifter, herunder at lære at spille det komplekse og abstrakte brætspil Go. Det nye projekt bygger på anden akademisk forskning, der søger at efterligne menneskelig opfattelse og intelligens ved hjælp af lignende beregningsværktøjer.

Det er et interessant og værdifuldt skridt i den rigtige retning, siger Josh Tenenbaum , en professor, der leder Computational Cognitive Science-gruppen ved MIT.

Tenenbaum siger, at evnen til at håndtere komplekse scener på en modulær måde er imponerende, men tilføjer, at tilgangen viser de samme begrænsninger som andre maskinlæringsmetoder, herunder et behov for en enorm mængde træningsdata: Juryen er stadig ude med, hvor meget af problemet dette løser.



Sam Gershman , der leder Computational Cognitive Neuroscience Lab ved Harvard, siger, at DeepMind-værket kombinerer nogle vigtige ideer om, hvordan menneskelig visuel perception fungerer. Men han bemærker, at den ligesom andre kunstig intelligens-programmer er noget snæver, idet den kun kan besvare en enkelt forespørgsel: hvordan ville en scene se ud fra et andet synspunkt?

I modsætning hertil kan mennesker besvare en uendelig række af spørgsmål om en scene, siger Gershman. Hvordan ville en scene se ud, hvis jeg flyttede den blå cirkel en smule til venstre, eller malede den røde trekant om eller knuste den gule terning?

Gershman siger, at det er uklart, om DeepMinds tilgang kan tilpasses til at besvare mere komplekse spørgsmål, eller om en fundamentalt anderledes tilgang kan være påkrævet.



skjule