OpenAIs Fedtmule Sumo-Wrestling Bots er smartere, end de ser ud

Kategori: Ikke kategoriseret Udsendt 12. okt

Det kunne være en virtuel blodsport i en eller anden absurdistisk techno-fremtid.





OpenAI, et forskningsinstitut bakket op af Elon Musk og flere andre store skud i Silicon Valley, har afsløret sin seneste forskning om udvikling af mere kraftfulde former for maskinlæring. Og det demonstrerer teknologien ved hjælp af virtuel sumobrydning.

De virtuelle wrestlere ser måske lidt latterlige ud, men de bruger en meget smart tilgang til læring i et hurtigt skiftende miljø, mens de håndterer en modstander.

Agenterne bruger en form for forstærkende læring, en teknik inspireret af den måde dyr lærer gennem feedback. Det har vist sig nyttigt til træning af computere til at spille spil og til at styre robotter (se 10 Breakthrough Technologies 2017: Reinforcement Learning).



En stor udfordring ved at bruge forstærkende læring er, at det ikke fungerer så godt i mere realistiske situationer, hvor tingene konstant er i forandring. OpenAI har allerede udviklet sin egen forstærkningsalgoritme kaldet proksimal politikoptimering (PPO) , som er særligt velegnet til skiftende miljøer.

Det seneste arbejde, udført i samarbejde med forskere fra Carnegie Mellon University og UC Berkeley, demonstrerer en måde for AI-agenter at anvende, hvad forskerne kalder en meta-læringsramme. Det betyder, at agenterne kan tage det, de allerede har lært, og anvende det i en ny situation.

Inde i RoboSumo-miljøet (se videoen ovenfor), startede agenterne ud med at opføre sig tilfældigt. Gennem tusindvis af gentagelser af forsøg og fejl udviklede de gradvist evnen til at bevæge sig – og til sidst at kæmpe. Gennem yderligere iterationer udviklede bryderne evnen til at undgå hinanden og endda til at stille spørgsmålstegn ved deres egne handlinger. Denne læring skete i en fart, hvor agenterne tilpassede sig, selv om de kæmpede med hinanden.



Fleksibel læring er en meget vigtig del af menneskelig intelligens, og det vil være afgørende, hvis maskiner skal blive i stand til at udføre andet end meget snævre opgaver i den virkelige verden. Denne form for læring er meget svær at implementere i maskiner, og det seneste arbejde er et lille, men væsentligt skridt i den retning.

Forskerne fandt ud af, at deres sumo-bots ved at bruge meta-læring kunne lære effektive strategier hurtigere. Så selvom de ser lidt ulykkelige ud, skal du ikke undervurdere dem.