AI-assistenter sier dumme ting, og vi er i ferd med å finne ut hvorfor

Brother UK | Flickr





Siri og Alexa er helt klart langt fra perfekte, men det er håp om at jevn fremgang innen maskinlæring vil gjøre dem til artikulerte hjelpere om ikke lenge. En ny test kan imidlertid bidra til å vise at en fundamentalt annen tilnærming kreves for at AI-systemer faktisk skal mestre språk.

Utviklet av forskere ved Allen Institute for AI (AI2), en ideell organisasjon basert i Seattle, den AI2 Reasoning Challenge (ARC) vil stille flervalgsvitenskapelige spørsmål på grunnskolenivå. Hvert spørsmål vil kreve en viss forståelse av hvordan verden fungerer. Prosjektet er beskrevet i en relatert forskningsoppgave (pdf).

Her er ett spørsmål: Hvilken gjenstand nedenfor er ikke laget av et materiale som er dyrket i naturen? (A) en bomullsskjorte (B) en trestol (C) en plastskje (D) en gresskurv



Et slikt spørsmål er enkelt for alle som vet at plast ikke er noe som vokser. Svaret slår inn i et fornuftsbilde av verden som selv små barn har.

Det er denne sunne fornuften AI-en bak stemmeassistenter, chatbots og oversettelsesprogramvare mangler. Og det er en grunn til at de er så lett forvirrede.

Språksystemer som er avhengige av maskinlæring kan ofte gi overbevisende svar på spørsmål hvis de har sett mange lignende eksempler før. Et program som er trent på mange tusen IT-støttechatter, for eksempel, kan være i stand til å utgi seg som en teknisk støttehjelper i begrensede situasjoner. Men et slikt system ville mislykkes hvis det ble spurt om noe som krevde bredere kunnskap.



Vi må bruke vår sunne fornuft til å fylle hullene rundt språket vi ser for å danne et sammenhengende bilde av det som blir uttalt, sier Peter Clark, hovedforsker på ARC-prosjektet. Maskiner har ikke denne sunne fornuften, og ser dermed kun det som er eksplisitt skrevet, og savner de mange implikasjonene og antakelsene som ligger til grunn for et tekststykke.

Den nye testen er en del av et initiativ hos AI2 for å gi AI-systemer en slik forståelse av verden. Og det er viktig fordi det kan være vanskelig å bestemme hvor godt et språksystem forstår hva det sier.

For eksempel utviklet forskere ved Microsoft og en annen gruppe ved Alibaba i januar spørsmål-og-svar-programmer som overgikk mennesker i en enkel test kalt Stanford Question Answering Dataset. Disse fremskrittene ble ledsaget av overskrifter som proklamerte at AI-programmer nå kunne lese bedre enn mennesker. Men programmene kunne ikke svare på mer komplekse spørsmål eller trekke på andre kunnskapskilder.



Teknologiselskaper vil fortsette å vise frem egenskapene til AI-systemer på denne måten. Microsoft kunngjør i dag at de har utviklet programvare som er i stand til å oversette engelske nyheter til kinesisk, og omvendt, med resultater som uavhengige frivillige anser som lik arbeidet til profesjonelle oversettere. Selskapets forskere brukte avanserte dyplæringsteknikker for å nå et nytt nivå av nøyaktighet. Selv om dette potensielt er veldig nyttig, ville systemet slite hvis det ble bedt om å oversette frittgående samtaler eller tekst fra et ukjent domene, for eksempel medisinske notater.

Gary Marcus , en professor ved NYU som har argumentert for viktigheten av sunn fornuft i AI, er oppmuntret av AI2-utfordringen. Jeg tror dette er en god motgift mot den typen overfladiske målestokker som har blitt så vanlige innen maskinlæring, sier han. Det burde virkelig tvinge AI-forskere til å øke spillet sitt.

gjemme seg