Et dataprogram som lærer å forestille seg verden viser hvordan AI kan tenke mer som oss

DeepMinds fremskritt kan føre til maskiner som kan gi bedre mening om en scene. 14. juni 2018

Deepmind





Maskiner må bli mye bedre til å forstå verden på egenhånd hvis de noen gang skal bli virkelig intelligente.

DeepMind , det AI-fokuserte datterselskapet til Alphabet, har tatt et skritt i den retningen ved å lage et dataprogram som bygger et mentalt bilde av verden helt av seg selv. Du kan si at den lærer å forestille seg verden rundt den.

Systemet, som bruker det DeepMinds forskere kaller et generativt spørrenettverk (GQN), ser på en scene fra flere vinkler og kan deretter beskrive hvordan den vil se ut fra en annen vinkel.



Dette kan virke trivielt, men det krever en relativt sofistikert evne til å lære om den fysiske verden. I motsetning til mange AI vision-systemer gir DeepMind-programmet mening om en scene mer på samme måte som en person gjør. Selv om noe for eksempel er delvis okkludert, kan det resonnere om hva som er der.

Til slutt kan slik teknologi bidra til å tjene som grunnlaget for dypere kunstig intelligens, og la maskiner beskrive og resonnere om verden med mye større raffinement.

Ali Eslami, en forsker ved DeepMind, og hans kolleger testet tilnærmingen på tre virtuelle innstillinger: en blokklignende bordplate, en virtuell robotarm og en enkel labyrint. Systemet bruker to nevrale nettverk; en lærer og en annen genererer, eller forestiller seg, nye perspektiver. Systemet fanger opp aspekter av en scene, inkludert objektformer, posisjoner og farger, ved hjelp av en vektorrepresentasjon, noe som gjør det relativt effektivt. Forskningen vises i tidsskriftet Vitenskap i dag.



Arbeidet er noe av en ny retning for DeepMind, som har gjort sitt navn ved å utvikle programmer som er i stand til å utføre bemerkelsesverdige bragder, inkludert å lære å spille det komplekse og abstrakte brettspillet Go. Det nye prosjektet bygger på annen akademisk forskning som søker å etterligne menneskelig persepsjon og intelligens ved å bruke lignende beregningsverktøy.

Det er et interessant og verdifullt steg i riktig retning, sier Josh Tenenbaum , en professor som leder Computational Cognitive Science-gruppen ved MIT.

Tenenbaum sier at evnen til å håndtere komplekse scener på en modulær måte er imponerende, men legger til at tilnærmingen viser de samme begrensningene som andre maskinlæringsmetoder, inkludert et behov for en enorm mengde treningsdata: Juryen er fortsatt ute på hvor mye av problemet dette løser.



Sam Gershman , som leder Computational Cognitive Neuroscience Lab ved Harvard, sier at DeepMind-arbeidet kombinerer noen viktige ideer om hvordan menneskelig visuell persepsjon fungerer. Men han bemerker at, i likhet med andre AI-programmer, er det noe smalt, ved at det bare kan svare på et enkelt spørsmål: hvordan ville en scene se ut fra et annet synspunkt?

I kontrast kan mennesker svare på en uendelig rekke spørsmål om en scene, sier Gershman. Hvordan ville en scene sett ut hvis jeg flyttet den blå sirkelen litt til venstre, eller malte den røde trekanten på nytt, eller knuste den gule kuben?

Gershman sier det er uklart om DeepMinds tilnærming kan tilpasses for å svare på mer komplekse spørsmål, eller om en fundamentalt annerledes tilnærming kan være nødvendig.



gjemme seg