211service.com
DeepMind ønsker å lære AI å spille et kortspill som er vanskeligere enn Go
Hvis du noen gang har spilt kortspillet Hanabi, vil du forstå når jeg sier at det er ulikt noe annet. Det er et samarbeidsspill der du har full oversikt over alle andres hender, men ikke dine egne.
For å vinne spillet, må hver spiller gi de andre hint om hendene sine over et begrenset antall runder for å arrangere alle kortene i en bestemt rekkefølge. Det er en intens øvelse i strategi, slutninger og samarbeid. Det er grunnen til at forskere ved Google Brain og DeepMind mener det er det perfekte spillet for AI å takle neste gang.
I en ny artikkel argumenterer de for at i motsetning til de andre spillene AI har mestret, som sjakk, Go og poker, krever Hanabi teori om sinn og et høyere nivå av resonnement. Theory of mind handler om å forstå andres mentale tilstander – og forstå at de kanskje ikke er de samme som din egen. Det er en grunnleggende ferdighet som mennesker bruker for å operere effektivt i verden, og en som vi vanligvis tar opp når vi er veldig unge.
Informasjon i Hanabi er begrenset både av antall hint som gis til spillerne i hvert spill og av hva som kan kommuniseres i hvert hint. Som et resultat må en AI-agent også plukke opp implisitt informasjon fra de andre spillernes handlinger for å vinne spillet – en utfordring den ikke har måttet møte før.
I tillegg må den lære å gi maksimalt mulig informasjon i sine egne hint og handlinger for å hjelpe de andre spillerne til å lykkes. Hvis en AI-agent kan lykkes med å navigere i et slikt miljø med ufullkommen informasjon, mener forskerne, vil det være ett skritt nærmere å samarbeide effektivt med mennesker.
Dette er alle nye utfordringer for forskningsmiljøet og vil kreve nye algoritmiske fremskritt som knytter sammen arbeidet til flere underfelt av AI, inkludert forsterkende læring, spillteori og emergent kommunikasjon – studiet av hvordan kommunikasjon oppstår mellom flere AI-agenter i samarbeidsmiljøer .
For å bekrefte denne hypotesen testet Google-teamet alle de nåværende toppmoderne forsterkningslæringsalgoritmene og fant ut at de yter dårlig. Som svar ga de ut et åpen kildekode Hanabi-miljø for å stimulere til videre arbeid i forskningsmiljøet.
Som forsker har jeg vært fascinert av hvordan AI-agenter kan lære å kommunisere og samarbeide med hverandre og til syvende og sist også mennesker, sier Jakob Foerster, en av avisens medforfattere. Hanabi gir en unik mulighet for en stor utfordring på dette området.