AlphaGo Zero viser at maskiner kan bli overmenneskelige uten hjelp

www.alphagomovie.com





AlphaGo var ikke den beste Go-spilleren på planeten på veldig lenge. En ny versjon av det mesterlige AI-programmet har dukket opp, og det er et monster. I en head-to-head-kamp beseiret AlphaGo Zero det originale programmet med 100 kamper mot ingen.

Det som er veldig kult er hvordan AlphaGo Zero gjorde det. Mens den originale AlphaGo lærte ved å innta data fra hundretusenvis av spill spilt av menneskelige eksperter, AlphaGo Zero, også utviklet av Alphabets datterselskap DeepMind , startet med ingenting annet enn et tomt brett og spillereglene. Den lærte ganske enkelt ved å spille millioner av spill mot seg selv, og bruke det den lærte i hvert spill for å forbedre seg.

Det nye programmet representerer et skritt fremover i søken etter å bygge maskiner som er virkelig intelligente. Det er fordi maskiner må finne løsninger på vanskelige problemer selv når det ikke er en stor mengde treningsdata å lære av.



Relatert historie

Det mest slående er at vi ikke trenger noen menneskelige data lenger, sier Demis Hassabis, administrerende direktør og medgründer av DeepMind. Hassabis sier at teknikkene som brukes til å bygge AlphaGo Zero er kraftige nok til å brukes i virkelige situasjoner der det er nødvendig å utforske et stort landskap av muligheter, inkludert medikamentoppdagelse og materialvitenskap. Forskningen bak AlphaGo Zero publiseres i dag i tidsskriftet Natur.

Under denne selvlærende prosessen oppdaget AlphaGo Zero mange av triksene og teknikkene som menneskelige Go-spillere har utviklet de siste tusen årene. Noen dager senere gjenoppdager den kjente beste skuespill, og i de siste dagene går utover disse stykkene for å finne noe enda bedre, sier Hassabis. Det er ganske kult å se.

DeepMind, basert i London, ble kjøpt opp av Google i 2014. Selskapet er fokusert på å gjøre store fremskritt innen AI ved å bruke spill, simulering og maskinlæring; det har ansatt hundrevis av AI-forskere i jakten på dette målet. Utviklingen av AlphaGo Zero involverte rundt 15 personer og sannsynligvis millioner av dollars dataressurser, sier Hassabis.



Både AlphaGo og AlphaGo Zero bruker en maskinlæringstilnærming kjent som forsterkningslæring (se 10 Breakthrough Technologies 2017: Reinforcement Learning ) samt dype nevrale nettverk. Forsterkende læring er inspirert av måten dyr ser ut til å lære gjennom eksperimentering og tilbakemeldinger, og DeepMind har brukt teknikken for å oppnå overmenneskelig ytelse i enklere Atari-spill.

Antallet mulige konfigurasjoner på Go-brettet er større enn antallet atomer i universet. www.alphagomovie.com

Å mestre brettspillet Go var imidlertid spesielt viktig fordi spillet er så komplekst og fordi de beste spillerne gjør bevegelsene sine så instinktivt. Reglene for godt spill kan med andre ord ikke enkelt forklares eller skrives i kode.



Forsterkende læring viser også løfte om automatisering av programmering av maskiner i mange andre sammenhenger, inkludert de der det ville være upraktisk å programmere dem for hånd. Det er allerede testet som en måte å lære roboter å gripe tak i vanskelige objekter, for eksempel, og som et middel til å spare energi i datasentre ved å rekonfigurere maskinvare på farten. I mange situasjoner i den virkelige verden kan det imidlertid ikke være et stort antall eksempler å lære av, noe som betyr at maskiner må lære selv. Det er det som gjør AlphaGo Zero interessant.

Ved å ikke bruke menneskelige data eller menneskelig ekspertise, har vi faktisk fjernet begrensningene for menneskelig kunnskap, sier David Silver , hovedforsker ved DeepMind og professor ved University College London. Den er i stand til å skape kunnskap for seg selv fra første prinsipper.

For å oppnå Go overherredømme, spilte AlphaGo Zero ganske enkelt mot seg selv, tilfeldig først. I likhet med originalen brukte den et dypt nevralt nettverk og en kraftig søkealgoritme for å velge neste trekk. Men i AlphaGo Zero tok et enkelt nevralt nettverk seg av begge funksjonene.



Martin Muller , en professor ved University of Alberta i Canada som har gjort viktig arbeid med Go-playing-programvare, er imponert over designet til AlphaGo Zero og sier at det fremmer forsterkende læring. Arkitekturen er enklere, men kraftigere enn tidligere versjoner, sier han.

DeepMind er allerede kjæresten til AI-industrien, og den siste prestasjonen vil garantert fange overskrifter og vekke debatt om fremgang mot mye kraftigere former for AI.

Det er imidlertid grunner til å ta kunngjøringen forsiktig. Peter søndager , en professor ved University of Washington, påpeker at programmet fortsatt må spille mange millioner spill for å mestre Go—mange mer enn en ekspert menneskelig spiller gjør. Dette antyder at intelligensen programmet bruker er fundamentalt annerledes på en eller annen måte.

Det er en fin illustrasjon av den nylige fremgangen innen dyp læring og forsterkende læring, men jeg ville ikke lest for mye i det som et tegn på hva datamaskiner kan lære uten menneskelig kunnskap, sier Domingos. Det som virkelig ville vært imponerende ville være hvis AlphaGo slo [den legendariske sørkoreanske mester] Lee Sedol etter å ha spilt omtrent like mange kamper som han spilte i karrieren før han ble mester. Det er vi ikke i nærheten av.

Faktisk innrømmer både Silver og Hassabis at det å finne måter for maskiner å lære av mye mindre data vil være viktig i deres pågående søken etter å mestre intelligens. Dette kan innebære å utvikle nye tilnærminger for å la maskiner overføre det de har lært i ett domene til et annet, eller å lære av å observere andre (både mennesker og andre AI-er).

Men til tross for arbeidet som gjenstår, håper Hassabis at innen 10 år vil AI spille en viktig rolle i å løse viktige problemer innen vitenskap, medisin eller andre felt. Jeg håper at denne typen algoritmer, og fremtidige versjoner, rutinemessig vil jobbe med oss ​​for å fremme grensene for vitenskap og medisin, sier han. Kanskje alle slags ting vil delvis ha blitt designet og oppdaget av denne typen algoritmer, som jobber sammen med veldig smarte mennesker.

gjemme seg