DeepMinds AI kan nu spille alle 57 Atari-spil - men det er stadig ikke alsidigt nok

Kategori: Kunstig intelligens Udsendt 01 apr Atari spil patroner Atari spil patroner





Nyhederne: En kunstig intelligens kaldet Agent57 har lært at spille alle 57 Atari videospil i Arcade Learning-miljøet, en samling klassiske spil, som forskere bruger til at teste grænserne for deres deep-learning-modeller. Agent57 er udviklet af DeepMind og bruger den samme dybe forstærkende læringsalgoritme til at opnå overmenneskelige niveauer af spil, selv i spil, som tidligere AI'er har kæmpet med. At kunne lære 57 forskellige opgaver gør Agent57 mere alsidig end tidligere spil-AI'er.

Hvad er der i et spil? Spil er en fantastisk måde at teste AI'er på. De giver en række udfordringer, der tvinger en AI til at komme med en række strategier og alligevel har et klart mål for succes - en score - at træne imod. Men især fire Atari-kampe har vist sig at være svære at slå. I Montezuma's Revenge and Pitfall skal en AI prøve en masse forskellige strategier, før han rammer en vindende. Og i Solaris og Skiløb kan der være lange ventetider mellem handling og belønning, hvilket gør det svært for en AI at lære, hvilke bevægelser der giver den bedste gevinst.

Meta-sind: For at imødekomme disse udfordringer samler Agent57 adskillige forbedringer, som DeepMind har lavet til sit Deep-Q-netværk, den AI, der først slog en håndfuld Atari-spil tilbage i 2012, inklusive en form for hukommelse, der lader den basere beslutninger på ting, den tidligere har gjort. ses i spillet og belønningssystemer, der tilskynder AI til at udforske sine muligheder mere fuldstændigt, før de lægger sig fast på en strategi. Disse forskellige teknikker styres derefter af en meta-controller, som balancerer afvejningen mellem at gå videre med en bestemt strategi og gøre mere udforskning.



Hvorfor det er vigtigt: På trods af al deres succes er de bedste deep-learning-modeller, vi har i dag, ikke særlig alsidige. De fleste har en tendens til at være gode til én ting og kun én ting. At træne en AI til at udmærke sig i mere end én opgave er en af ​​de største åbne udfordringer inden for dyb læring. Evnen til at lære 57 forskellige opgaver gør Agent57 mere alsidig end tidligere game-playing AI'er, men - og dette bliver ofte savnet - det kan stadig ikke lære at spille mere end ét spil ad gangen. Agent57 kan lære at spille 57 spil, men den kan ikke lære at spille 57 spil på én gang. Det skal genoptrænes for hvert nyt spil, selvom det kan bruge den samme algoritme til at gøre det. På denne måde ligner Agent57 AlphaZero, DeepMinds dybe forstærkende læringsalgoritme, som kan lære at spille skak, Go og shogi - men igen, ikke alt på én gang. Ægte alsidighed, som kommer så let til et menneskeligt spædbarn, er stadig langt uden for AI'ers rækkevidde.