DeepMinds AI kan nå spille alle 57 Atari-spill – men den er fortsatt ikke allsidig nok

Kategori: Kunstig intelligens Lagt ut 01. april Atari-spillkassetter Atari-spillkassetter





Nyhetene: En kunstig intelligens kalt Agent57 har lært å spille alle de 57 Atari-videospillene i Arcade Learning-miljøet, en samling klassiske spill som forskere bruker for å teste grensene for deres dyplæringsmodeller. Agent57 er utviklet av DeepMind og bruker den samme dype forsterkningslæringsalgoritmen for å oppnå overmenneskelige nivåer av spill selv i spill som tidligere AI-er har slitt med. Å kunne lære 57 forskjellige oppgaver gjør Agent57 mer allsidig enn tidligere spill-AI-er.

Hva er i et spill? Spill er en fin måte å teste AI-er på. De gir en rekke utfordringer som tvinger en AI til å komme opp med en rekke strategier og likevel har et klart mål på suksess – en poengsum – å trene mot. Men spesielt fire Atari-kamper har vist seg å være vanskelig å slå. I Montezumas Revenge and Pitfall må en AI prøve mange forskjellige strategier før han treffer en vinnende. Og i Solaris og Ski kan det være lange ventetider mellom handling og belønning, noe som gjør det vanskelig for en AI å lære hvilke trekk som gir best uttelling.

Meta-sinn: For å møte disse utfordringene, samler Agent57 flere forbedringer som DeepMind har gjort til Deep-Q-nettverket sitt, AI-en som først slo en håndfull Atari-spill tilbake i 2012, inkludert en form for minne som lar den basere beslutninger på ting den har tidligere sett i spillet og belønningssystemer som oppmuntrer AI til å utforske alternativene sine mer fullstendig før de bestemmer seg for en strategi. Disse ulike teknikkene administreres deretter av en metakontroller, som balanserer avveiningene mellom å gå videre med en bestemt strategi og gjøre mer utforskning.



Hvorfor det er viktig: Til tross for all suksess er de beste dyplæringsmodellene vi har i dag ikke veldig allsidige. De fleste pleier å være gode på én ting og kun én ting. Å trene en AI til å utmerke seg i mer enn én oppgave er en av de største åpne utfordringene innen dyp læring. Evnen til å lære 57 forskjellige oppgaver gjør Agent57 mer allsidig enn tidligere spill-AI-er, men – og dette blir ofte savnet – kan den fortsatt ikke lære å spille mer enn ett spill om gangen. Agent57 kan lære å spille 57 kamper, men den kan ikke lære å spille 57 kamper samtidig. Det må trenes på nytt for hvert nytt spill, selv om det kan bruke samme algoritme for å gjøre det. På denne måten ligner Agent57 på AlphaZero, DeepMinds dypforsterkende læringsalgoritme, som kan lære å spille sjakk, Go og shogi – men igjen, ikke alt på en gang. Ekte allsidighet, som kommer så lett til et menneskelig spedbarn, er fortsatt langt utenfor AIs rekkevidde.