211service.com
AlphaGo Zero viser, at maskiner kan blive overmenneskelige uden hjælp
www.alphagomovie.com
AlphaGo var ikke den bedste Go-spiller på planeten i meget lang tid. En ny version af det mesterlige AI-program er dukket op, og det er et monster. I en head-to-head matchup besejrede AlphaGo Zero det originale program med 100 spil mod ingen.
Det, der er rigtig fedt, er, hvordan AlphaGo Zero gjorde det. Mens den originale AlphaGo lærte ved at indtage data fra hundredtusindvis af spil spillet af menneskelige eksperter, AlphaGo Zero, også udviklet af Alphabets datterselskab DeepMind , startede med intet andet end en blank tavle og spillereglerne. Det lærte simpelthen ved at spille millioner af spil mod sig selv, ved at bruge det, det lærte i hvert spil til at forbedre sig.
Det nye program repræsenterer et skridt fremad i søgen efter at bygge maskiner, der er virkelig intelligente. Det skyldes, at maskiner skal finde ud af løsninger på vanskelige problemer, selv når der ikke er en stor mængde træningsdata at lære af.
Relateret historie
Relateret historieDet mest slående er, at vi ikke har brug for nogen menneskelige data længere, siger Demis Hassabis, CEO og medstifter af DeepMind. Hassabis siger, at de teknikker, der bruges til at bygge AlphaGo Zero, er kraftfulde nok til at blive anvendt i situationer i den virkelige verden, hvor det er nødvendigt at udforske et stort landskab af muligheder, herunder opdagelse af lægemidler og materialevidenskab. Forskningen bag AlphaGo Zero offentliggøres i dag i tidsskriftet Natur.
Det er bemærkelsesværdigt, at AlphaGo Zero under denne selvlærende proces opdagede mange af de tricks og teknikker, som menneskelige Go-spillere har udviklet i løbet af de sidste flere tusinde år. Et par dage efter genopdager den kendte bedste skuespil, og i de sidste dage går den ud over disse skuespil for at finde noget endnu bedre, siger Hassabis. Det er ret fedt at se.
DeepMind, der er baseret i London, blev opkøbt af Google i 2014. Virksomheden er fokuseret på at gøre store fremskridt inden for kunstig intelligens ved hjælp af spil, simulering og maskinlæring; det har ansat hundredvis af AI-forskere for at nå dette mål. Udviklingen af AlphaGo Zero involverede omkring 15 mennesker og sandsynligvis millioner af dollars i computerressourcer, siger Hassabis.
Både AlphaGo og AlphaGo Zero bruger en maskinlæringstilgang kendt som reinforcement learning (se 10 Breakthrough Technologies 2017: Reinforcement Learning ) samt dybe neurale netværk. Forstærkningslæring er inspireret af den måde, dyr ser ud til at lære gennem eksperimenter og feedback, og DeepMind har brugt teknikken til at opnå overmenneskelig præstation i enklere Atari-spil.

Antallet af mulige konfigurationer på Go-brættet er større end antallet af atomer i universet. www.alphagomovie.com
At mestre brætspillet Go var dog især vigtigt, fordi spillet er så komplekst, og fordi de bedste spillere foretager deres træk så instinktivt. Reglerne for godt spil kan med andre ord ikke nemt forklares eller skrives i kode.
Forstærkende læring viser også løfte om at automatisere programmeringen af maskiner i mange andre sammenhænge, inklusive dem, hvor det ville være upraktisk at programmere dem i hånden. Det er allerede ved at blive testet som en måde at lære robotter at gribe fat i akavede objekter, for eksempel, og som et middel til at spare energi i datacentre ved at omkonfigurere hardware på farten. I mange situationer i den virkelige verden er der dog muligvis ikke et stort antal eksempler at lære af, hvilket betyder, at maskiner bliver nødt til at lære selv. Det er det, der gør AlphaGo Zero interessant.
Ved ikke at bruge menneskelige data eller menneskelig ekspertise, har vi faktisk fjernet begrænsningerne for menneskelig viden, siger David Silver , ledende forsker ved DeepMind og professor ved University College London. Det er i stand til at skabe viden til sig selv fra første principper.
For at opnå Go overherredømme spillede AlphaGo Zero simpelthen mod sig selv, tilfældigt i starten. Ligesom originalen brugte den et dybt neuralt netværk og en kraftfuld søgealgoritme til at vælge det næste træk. Men i AlphaGo Zero tog et enkelt neuralt netværk sig af begge funktioner.
Martin Muller , en professor ved University of Alberta i Canada, som har udført vigtigt arbejde med Go-playing-software, er imponeret over designet af AlphaGo Zero og siger, at det fremmer forstærkningslæring. Arkitekturen er enklere, men alligevel mere kraftfuld end tidligere versioner, siger han.
DeepMind er allerede AI-industriens elskede, og dens seneste præstation vil helt sikkert fange overskrifter og sætte gang i debat om fremskridt hen imod meget mere kraftfulde former for AI.
Der er dog grund til at tage meddelelsen varsomt. Peter søndage , en professor ved University of Washington, påpeger, at programmet stadig skal spille mange millioner spil for at mestre Go - mange flere end en ekspert, menneskelig spiller gør. Dette tyder på, at den intelligens, programmet anvender, er fundamentalt anderledes på en eller anden måde.
Det er en fin illustration af de seneste fremskridt inden for deep learning og forstærkende læring, men jeg ville ikke læse for meget i det som et tegn på, hvad computere kan lære uden menneskelig viden, siger Domingos. Hvad der ville være virkelig imponerende ville være, hvis AlphaGo slog [den legendariske sydkoreanske mester] Lee Sedol efter at have spillet nogenlunde lige så mange kampe, som han spillede i sin karriere, før han blev en mester. Det er vi ikke i nærheden af.
Faktisk indrømmer både Silver og Hassabis, at det at finde måder, hvorpå maskiner kan lære af meget mindre data, vil være vigtigt i deres igangværende søgen efter at mestre intelligens. Dette kan involvere udvikling af nye tilgange til at lade maskiner overføre, hvad de har lært i et domæne til et andet, eller at lære af at observere andre (både mennesker og andre AI'er).
Men på trods af det arbejde, der stadig skal gøres, håber Hassabis, at AI inden for 10 år vil spille en vigtig rolle i løsningen af vigtige problemer inden for videnskab, medicin eller andre områder. Jeg håber, at den slags algoritmer og fremtidige versioner rutinemæssigt vil arbejde sammen med os for at fremme grænserne for videnskab og medicin, siger han. Måske er alle mulige ting delvist designet og opdaget af den slags algoritmer, der arbejder sammen med meget smarte mennesker.