Teknikken som lærte AI å spille Go kan fortsatt ikke lære en bil å kjøre

Kategori: Kunstig intelligens Lagt ut 15. januar

Forsterkende læring (RL), kategorien maskinlæring som er avhengig av straffer og belønninger, kan være en kraftig teknikk for å lære maskiner å tilpasse seg nye miljøer.





Deepminds AlphaGo brukte den til å beseire verdens beste Go-spiller til tross for at han aldri hadde spilt ham før. Det har også vist lovende i å lage roboter som kan yte under skiftende forhold.

Men teknikken har sine begrensninger. Det krever at en maskin tuller rundt ettersom den sakte foredler handlingene sine over tid. Det er greit i laboratoriet, eller når du spiller et brettspill. Den er mindre enn ideell for bruksområder, som selvkjørende biler, der en tabbe kan være dødelig.

Som svar har forskere utviklet forskjellige måter å omgå behovet for trening i den virkelige verden. En bil kan bruke trafikkdata til å lære å kjøre i en sikker digital kopi av den fysiske verden, for eksempel for å komme forbi feilstadiet uten å sette noen i fare.



Men dette er ikke en perfekt løsning. En maskin kan fortsatt gjøre kostbare feil når den støter på situasjoner utenfor rekkevidden av treningsdataene. I ett tilfelle oppdaget forskere ved New York University at en bil hadde lært å gjøre 90-graders svinger til møtende trafikk (heldigvis innenfor en simulering) fordi treningsdatasettet ikke omfattet slike scenarier. Det er unødvendig å si at dette ikke er levedyktig for trygg opplæring av en selvkjørende bil eller for eksempel en robotkirurg.

Det samme teamet ved NYU og direktøren for AI-forskning på Facebook, Yann Lecun, er nå foreslår en ny metode som kan løse dette problemet. I tillegg til å straffe og belønne en bil for kjøreatferd, straffet de den også for å forville seg inn i scenarier der den ikke har nok treningsdata.

I hovedsak tvinger dette bilen til å gå mer forsiktig frem, forklarer Mikael Henaff, en av forfatterne av studien, i stedet for å gjøre ville svinger og andre manøvrer som plasserer den rett i ukjent territorium.



Da de testet sin nye tilnærming, fant de ut at den var bedre enn tidligere metoder for å få bilen til å navigere trygt i tett trafikk. Det var fortsatt ikke like bra som menneskelig ytelse, så det gjenstår fortsatt arbeid.

Denne historien dukket opprinnelig opp i vårt AI-nyhetsbrev The Algorithm. For å lese historier som dette først, få The Algorithm levert direkte i innboksen din. Abonner her gratis.