En uendelig skiftende lekeplass lærer AI-er å multitaske

DeepMind





DeepMind har utviklet en stor, godterifarget virtuell lekeplass som lærer AIs generelle ferdigheter ved uendelig å endre oppgavene den setter dem. I stedet for å utvikle bare ferdighetene som trengs for å løse en bestemt oppgave, lærer AI-ene å eksperimentere og utforske, og plukker opp ferdigheter de deretter bruker for å lykkes med oppgaver de aldri har sett før. Det er et lite skritt mot generell intelligens.

Hva er det? XLand er en videospilllignende 3D-verden som AI-spillerne fornemmer i farger. Lekeplassen administreres av en sentral AI som setter spillerne milliarder av forskjellige oppgaver ved å endre miljøet, spillereglene og antall spillere. Både spillerne og lekeplasssjefen bruker forsterkende læring for å forbedre seg ved å prøve og feile.

Kunstig generell intelligens: Er vi nærme, og er det i det hele tatt fornuftig å prøve?

En maskin som kan tenke som en person har vært den veiledende visjonen for AI-forskning siden de tidligste dagene – og er fortsatt dens mest splittende idé.



Under trening møter spillerne først enkle enspillerspill, som å finne en lilla kube eller å plassere en gul ball på et rødt gulv. De går videre til mer komplekse flerspillerspill som gjemsel eller fange flagget, der lagene konkurrerer om å være de første til å finne og gripe motstanderens flagg. Lekeplasssjefen har ikke noe spesifikt mål, men har som mål å forbedre spillernes generelle kapasitet over tid.

Hvorfor er dette kult? AI-er som DeepMinds AlphaZero har slått verdens beste menneskelige spillere i sjakk og Go. Men de kan bare lære ett spill om gangen. Som DeepMind-medgrunnlegger Shane Legg sa det da jeg snakket med ham i fjor, er det sånn å bytte ut sjakkhjernen med Go-hjernen hver gang du vil bytte spill.

Forskere prøver nå å bygge AI-er som kan lære flere oppgaver samtidig, noe som betyr å lære dem generelle ferdigheter som gjør det lettere å tilpasse seg.



video av AI-agenter som eksperimenterer i et virtuelt miljø

Etter å ha lært å eksperimentere, improviserte disse robotene en rampe

DYPT SINN

En spennende trend i denne retningen er åpen læring, hvor AI-er trenes på mange forskjellige oppgaver uten et spesifikt mål. På mange måter er det slik mennesker og andre dyr ser ut til å lære, via formålsløs lek. Men dette krever en enorm mengde data. XLand genererer disse dataene automatisk, i form av en endeløs strøm av utfordringer. Det ligner på DIKTER , en AI-treningsdojo der tobeinte roboter lærer å navigere i hindringer i et 2D-landskap. XLands verden er imidlertid mye mer kompleks og detaljert.

XLand er også et eksempel på AI lærer å lage seg selv , eller hva Jeff Clune, som hjalp til med å utvikle POET og leder et team jobber med dette temaet hos OpenAI, kaller AI-genererende algoritmer (AI-GA). Dette arbeidet flytter grensene til AI-GA, sier Clune. Det er veldig spennende å se.



AI lærer å skape seg selv

Mennesker har kjempet for å lage virkelig intelligente maskiner. Kanskje vi må la dem fortsette med det selv.

Hva lærte de? Noen av DeepMinds XLand AIer spilte 700 000 forskjellige spill i 4000 forskjellige verdener, og møtte totalt 3,4 millioner unike oppgaver. I stedet for å lære den beste tingen å gjøre i hver situasjon, som er det de fleste eksisterende AI-er for forsterkning gjør, lærte spillerne å eksperimentere – flytte objekter rundt for å se hva som skjedde, eller bruke ett objekt som et verktøy for å nå et annet objekt eller gjemme seg bak – helt til de slo den spesielle oppgaven.

I videoene kan du se AI-ene kaste gjenstander rundt til de snubler over noe nyttig: en stor flis, for eksempel, blir en rampe opp til en plattform. Det er vanskelig å vite sikkert om alle slike utfall er tilsiktede eller lykkelige ulykker, sier forskerne. Men de skjer konsekvent.



AI-er som lærte å eksperimentere hadde en fordel i de fleste oppgaver, også de som de ikke hadde sett før. Forskerne fant at etter bare 30 minutter med trening på en kompleks ny oppgave, tilpasset XLand AI-ene seg raskt. Men AI-er som ikke hadde brukt tid i XLand kunne ikke lære disse oppgavene i det hele tatt.

gjemme seg