211service.com
Uber har knekt to klassiske 80-talls videospill ved å gi en AI-algoritme en ny type minne
Squakenet
En ny type maskinlæringsalgoritme mestret nettopp et par tilbakevendende videospill som har vist seg å være en stor hodepine for AI.
De som følger med vil vite at AI-algoritmer har overvunnet verdens beste menneskelige spillere i det eldgamle, elegante strategispillet Go, et av de vanskeligste spillene man kan tenke seg. Men to pikselerte klassikere fra epoken med 8-bits dataspill – Montezumas hevn og fallgruve! – har hindret AI-forskere.
Det er en grunn til denne tilsynelatende motsetningen. Selv om det er villedende enkelt, både Montezumas hevn og fallgruve! har vært immune mot mestring via forsterkende læring, en teknikk som ellers er dyktig til å lære å erobre videospill. DeepMind, et datterselskap av Alphabet fokusert på kunstig intelligens, brukte det kjent for å utvikle algoritmer som er i stand til å lære å spille flere klassiske videospill på ekspertnivå. Forsterkningslæringsalgoritmer passer godt sammen med de fleste spill, fordi de justerer oppførselen sin som svar på positive tilbakemeldinger – poengsummen øker. Suksessen til tilnærmingen har skapt håp om at AI-algoritmer kan lære seg selv å gjøre alle slags nyttige ting som for øyeblikket er umulige for maskiner.
Problemet med både Montezumas hevn og fallgruve! er at det er få pålitelige belønningssignaler. Begge titlene involverer typiske scenarier: hovedpersonene utforsker blokkaktige verdener fylt med dødelige skapninger og feller. Men i hvert tilfelle hjelper ikke mange atferder som er nødvendige for å avansere i spillet å øke poengsummen før mye senere. Vanlige forsterkningslæringsalgoritmer klarer vanligvis ikke å komme seg ut av det første rommet i Montezumas hevn, og i fallgruven! de scorer nøyaktig null.
De nye algoritmene kommer fra Ubers AI-forskningsteam i San Francisco, ledet av Jeff Clune , som også er førsteamanuensis ved University of Wyoming. Teamet demonstrerte en fundamentalt annerledes tilnærming til maskinlæring i et miljø som gir få ledetråder for å vise en algoritme hvordan det går.
Tilnærmingen fører til noen interessante praktiske anvendelser, skriver Clune og teamet hans i et blogginnlegg utgitt i dag – for eksempel innen robotlæring. Det er fordi fremtidige roboter må finne ut hva de skal gjøre i miljøer som er komplekse og tilbyr bare noen få sparsomme belønninger.
Uber lanserte sitt AI-laboratorium i desember 2016, med mål om å gjøre grunnleggende gjennombrudd som kan vise seg å være nyttige for virksomheten. Bedre forsterkningslæringsalgoritmer kan til slutt vise seg nyttige for ting som autonom kjøring og optimalisering av kjøretøyruter.
AI-forskere har vanligvis forsøkt å omgå problemene fra Montezumas Revenge and Pitfall! ved å instruere forsterkningslæringsalgoritmer til å utforske tilfeldig til tider, mens du legger til belønninger for utforskning – det som er kjent som indre motivasjon.
Men Uber-forskerne mener dette ikke klarer å fange et viktig aspekt ved menneskelig nysgjerrighet. Vi antar at en stor svakhet ved dagens indre motivasjonsalgoritmer er løsrivelse, skriver de. Hvor algoritmene glemmer lovende områder de har besøkt, noe som betyr at de ikke vender tilbake til dem for å se om de fører til nye stater.
Teamets nye familie av forsterkningslæringsalgoritmer, kalt Go-Explore, husker hvor de har vært før, og vil returnere til et bestemt område eller oppgave senere for å se om det kan bidra til å gi bedre generelle resultater. Forskerne fant også at å legge til litt domenekunnskap, ved å la menneskelige spillere fremheve interessante eller viktige områder, fremskyndet algoritmenes læring og fremgang bemerkelsesverdig mye. Dette er viktig fordi det kan være mange situasjoner i den virkelige verden der du ønsker at en algoritme og en person skal jobbe sammen for å løse en vanskelig oppgave.
Koden deres scorer i gjennomsnitt 400 000 poeng i Montezuma's Revenge - en størrelsesorden høyere enn gjennomsnittet for menneskelige eksperter. I fallgruven! den samler opp 21 000 i gjennomsnitt, langt bedre enn de fleste menneskelige spillere.
Disse resultatene er veldig imponerende, sier Emma Brunskill, en assisterende professor ved Stanford University som spesialiserer seg på forsterkende læring. Hun sier det er overraskende, og spennende, at teknikkene ga så store fordeler.
Andre AI-forskere har kikket på disse notorisk harde videospillene. I oktober demonstrerte et team ved OpenAI, en ideell organisasjon i San Francisco, en algoritme som kan gjør betydelig fremgang i Montezumas hevn.
Brunskills gruppe på Stanford nylig gjort mer beskjedne fremgang på fallgruven! ved å bruke en tilnærming som ligner på Uber-teamets.
Nå som AI-algoritmer kan løse disse videospillene, er utfordringen å komme ut av arkaden og løse problemer i den virkelige verden.
Brunskill er enig i at denne typen arbeid kan ha stor innvirkning på robotikk. Men hun sier at andre situasjoner i den virkelige verden, spesielt de som involverer modellering av menneskelig atferd, er langt vanskeligere. Det blir veldig interessant å se hvor godt denne tilnærmingen fungerer for mer kompliserte settinger, sier hun.
Ikke alle er betatt av Uber-forskningen.
Alex Irpan, en programvareingeniør som jobber med maskinlæring og robotikk hos Google, skrev et blogginnlegg der han stiller spørsmål ved hvorfor Uber AI-teamet ikke hadde gitt et teknisk dokument, sammen med en pressemelding, for å gi flere detaljer om arbeidet deres.
Irpan påpeker også at ved å endre spillets tilstand, for å lette deres tilnærming, kan Uber AI-forskerne ha endret spillefeltet på en betydelig måte. Gitt dette faktum stiller han spørsmål ved hvor praktisk tilnærmingen kan være.
Blogginnlegget sier at denne tilnærmingen kan brukes til simulerte robotikkoppgaver, og deretter kombinert med sim-til-virkelig overføring for å få virkelige retningslinjer. På denne fronten er jeg ganske pessimistisk, skriver han.
Oppdatert 11.28 med kommentar fra Alex Irpan.