Disse virtuelle robotarme bliver klogere ved at træne hinanden





til virtuelle robotarm har lært at løse en lang række forskellige gåder —stabling af blokke, dække bord, arrangere skakbrikker — uden at skulle genoptrænes til hver opgave. Det gjorde den ved at spille mod en anden robotarm, der var trænet til at give den sværere og sværere udfordringer.

Selvspil: Udviklet af forskere ved OpenAI , de identiske robotarme - Alice og Bob - lærer ved at spille et spil mod hinanden i en simulation uden menneskelig input. Robotterne bruger forstærkningslæring, en teknik, hvor AI'er trænes ved at prøve og fejle, hvilke handlinger der skal tages i forskellige situationer for at nå bestemte mål. Spillet går ud på at flytte objekter rundt på en virtuel bordplade. Ved at arrangere genstande på bestemte måder, forsøger Alice at sætte gåder, som er svære for Bob at løse. Bob forsøger at løse Alices gåder. Efterhånden som de lærer, sætter Alice mere komplekse gåder, og Bob bliver bedre til at løse dem.

Efter at have trænet på blokpuslespil sat af Alice, kan Bob generalisere til en række opgaver, herunder at dække et bord og arrangere skakbrikker.



Multitasking: Dyblæringsmodeller skal typisk genoptrænes mellem opgaverne. For eksempel bruger AlphaZero (som også lærer ved at spille mod sig selv) en enkelt algoritme til at lære sig selv at spille skak, shogi og Go – men kun ét spil ad gangen. Den skakspiller AlphaZero kan ikke spille Go, og den Go-spiller kan ikke spille shogi. Det er et stort uløst problem at bygge maskiner, der virkelig kan multitaske vejen til mere generel kunstig intelligens .

AI dojo: Et problem er, at træning af en AI til at multitaske kræver et stort antal eksempler. OpenAI undgår dette ved at træne Alice til at generere eksemplerne til Bob ved at bruge en AI til at træne en anden. Alice lærte at sætte sig mål som at bygge et tårn af blokke og derefter samle det op og afbalancere det. Bob lærte at bruge egenskaber ved det (virtuelle) miljø, såsom friktion, til at gribe og rotere objekter.

Virtual reality: Indtil videre er tilgangen kun blevet testet i en simulering, men forskere hos OpenAI og andre steder bliver bedre til at overføre modeller trænet i virtuelle miljøer til fysiske. En simulering lader AI'er churne gennem store datasæt på kort tid, før de finjusteres til indstillinger i den virkelige verden.



Overordnet ambition: Forskerne siger, at deres ultimative mål er at træne en robot til at løse enhver opgave, som en person måtte bede den om. Ligesom GPT-3, en sprogmodel, der kan bruge sproget på en lang række forskellige måder, er disse robotarme en del af OpenAIs overordnede ambition om at bygge en multitasking AI. At bruge en AI til at træne en anden kunne være en vigtig del af det.

skjule