211service.com
Uber har knækket to klassiske 80'er-videospil ved at give en AI-algoritme en ny type hukommelse
Squakenet
En ny slags maskinlæringsalgoritme har lige mestret et par tilbagevendende videospil, der har vist sig at være en stor hovedpine for AI.
De, der følger med, vil vide, at AI-algoritmer har slået verdens bedste menneskelige spillere i det ældgamle, elegante strategispil Go, et af de sværest tænkelige spil. Men to pixelerede klassikere fra æraen med 8-bit computerspil – Montezumas hævn og faldgrube! – har hindret AI-forskere.
Der er en grund til denne tilsyneladende modsætning. Selvom det er vildledende simpelt, er både Montezumas hævn og faldgrube! har været immune over for mestring via forstærkningslæring, en teknik, der ellers er dygtig til at lære at erobre videospil. DeepMind, et datterselskab af Alphabet med fokus på kunstig intelligens, brugte det berømt til at udvikle algoritmer, der er i stand til at lære at spille flere klassiske videospil på ekspertniveau. Forstærkningsindlæringsalgoritmer passer godt sammen med de fleste spil, fordi de justerer deres adfærd som svar på positiv feedback - scoren stiger. Succesen med tilgangen har skabt håb om, at AI-algoritmer kunne lære sig selv at gøre alle mulige nyttige ting, som i øjeblikket er umulige for maskiner.
Problemet med både Montezumas hævn og faldgrube! er, at der er få pålidelige belønningssignaler. Begge titler involverer typiske scenarier: hovedpersoner udforsker blokagtige verdener fyldt med dødbringende væsner og fælder. Men i hvert tilfælde hjælper masser af adfærd, der er nødvendige for at komme videre i spillet, ikke med at øge scoren før meget senere. Almindelige forstærkningsindlæringsalgoritmer formår normalt ikke at komme ud af det første rum i Montezumas hævn og i faldgruben! de scorer præcis nul.
De nye algoritmer kommer fra Ubers AI-forskerhold i San Francisco, ledet af Jeff Clune , som også er lektor ved University of Wyoming. Holdet demonstrerede en fundamentalt anderledes tilgang til maskinlæring i et miljø, der giver få ledetråde til at vise en algoritme, hvordan den klarer sig.
Tilgangen fører til nogle interessante praktiske applikationer, skriver Clune og hans team i et blogindlæg, der blev udgivet i dag – for eksempel inden for robotlæring. Det er fordi fremtidige robotter bliver nødt til at finde ud af, hvad de skal gøre i miljøer, der er komplekse og kun tilbyder et par sparsomme belønninger.
Uber lancerede sit AI-laboratorium i december 2016 med det mål at lave fundamentale gennembrud, der kan vise sig nyttige for virksomheden. Bedre forstærkningsindlæringsalgoritmer kan i sidste ende vise sig at være nyttige til ting som autonom kørsel og optimering af køretøjsruter.
AI-forskere har typisk forsøgt at komme uden om problemerne fra Montezumas hævn og faldgrube! ved at instruere forstærkningslæringsalgoritmer til at udforske tilfældigt til tider, samtidig med at der tilføjes belønninger for udforskning - det, der er kendt som indre motivation.
Men Uber-forskerne mener, at dette ikke formår at fange et vigtigt aspekt af menneskelig nysgerrighed. Vi antager, at en væsentlig svaghed ved de nuværende iboende motivationsalgoritmer er løsrivelse, skriver de. Hvori algoritmerne glemmer lovende områder, de har besøgt, hvilket betyder, at de ikke vender tilbage til dem for at se, om de fører til nye stater.
Holdets nye familie af forstærkningsindlæringsalgoritmer, kaldet Go-Explore, husker, hvor de har været før, og vender tilbage til et bestemt område eller en opgave senere for at se, om det kan hjælpe med at give bedre overordnede resultater. Forskerne fandt også ud af, at tilføjelse af en lille smule domæneviden, ved at lade menneskelige spillere fremhæve interessante eller vigtige områder, fremskyndede algoritmernes læring og fremskridt med en bemærkelsesværdig mængde. Dette er vigtigt, fordi der kan være mange situationer i den virkelige verden, hvor du vil have en algoritme og en person til at arbejde sammen for at løse en svær opgave.
Deres kode scorer i gennemsnit 400.000 point i Montezuma's Revenge - en størrelsesorden højere end gennemsnittet for menneskelige eksperter. I faldgruben! den samler 21.000 i gennemsnit, langt bedre end de fleste menneskelige spillere.
Disse resultater er meget imponerende, siger Emma Brunskill, en assisterende professor ved Stanford University, som har specialiseret sig i forstærkende læring. Hun siger, at det er overraskende og spændende, at teknikkerne gav så store fordele.
Andre AI-forskere har snydt løs på disse notorisk hårde videospil. I oktober demonstrerede et hold hos OpenAI, en nonprofitorganisation i San Francisco, en algoritme, der kan gør betydelige fremskridt i Montezumas hævn.
Brunskills gruppe på Stanford for nylig gjort mere beskedne fremskridt på faldgruben! ved at bruge en tilgang svarende til Uber-teamets.
Nu hvor AI-algoritmer kan løse disse videospil, er udfordringen at komme ud af arkaden og løse problemer i den virkelige verden.
Brunskill er enig i, at denne form for arbejde kan have stor indflydelse på robotteknologi. Men hun siger, at andre situationer i den virkelige verden, især dem, der involverer modellering af menneskelig adfærd, er langt vanskeligere. Det bliver meget interessant at se, hvor godt denne tilgang fungerer i mere komplicerede omgivelser, siger hun.
Ikke alle er dog betaget af Uber-forskningen.
Alex Irpan, en softwareingeniør, der arbejder med maskinlæring og robotteknologi hos Google, skrev et blogindlæg hvori han stiller spørgsmålstegn ved, hvorfor Uber AI-teamet ikke havde leveret et teknisk papir, sammen med en pressemeddelelse, for at give flere detaljer om deres arbejde.
Irpan påpeger også, at ved at ændre spillets tilstand, for at lette deres tilgang, kan Uber AI-forskerne have ændret spillefeltet på en væsentlig måde. I betragtning af denne kendsgerning stiller han spørgsmålstegn ved, hvor praktisk tilgangen kan være.
Blogindlægget siger, at denne tilgang kunne bruges til simulerede robotopgaver og derefter kombineres med sim-til-real-overførsel for at få politikker fra den virkelige verden. På denne front er jeg ret pessimistisk, skriver han.
Opdateret 11.28 med kommentar fra Alex Irpan.