Blandede setninger viser at AI-er fortsatt ikke forstår språk

fliser scrabble

Ms Tech | Unsplash / Brett Jordan





Mange AI-er som ser ut til å forstå språk og som skårer bedre enn mennesker på et vanlig sett med forståelsesoppgaver, legger ikke merke til når ordene i en setning er blandet sammen, noe som viser at de forstår egentlig ikke språk i det hele tatt . Problemet ligger i måten NLP-systemer (natural-language processing) trenes på; det peker også på en måte å gjøre dem bedre på.

Måten vi trener AI på er grunnleggende feil Prosessen som brukes til å bygge de fleste maskinlæringsmodellene vi bruker i dag kan ikke si om de vil fungere i den virkelige verden eller ikke – og det er et problem.

Forskere ved Auburn University i Alabama og Adobe Research oppdaget feilen da de prøvde å få et NLP-system til å generere forklaringer for dets oppførsel, for eksempel hvorfor det hevdet at forskjellige setninger betydde det samme. Da de testet tilnærmingen sin, innså de at det å blande ord i en setning ikke gjorde noen forskjell for forklaringene. Dette er et generelt problem for alle NLP-modeller, sier Anh Nguyen ved Auburn University, som ledet arbeidet.

Teamet så på flere toppmoderne NLP-systemer basert på BERT (en språkmodell utviklet av Google som underbygger mange av de nyeste systemene, inkludert GPT-3). Alle disse systemene scorer bedre enn mennesker på LIM (General Language Understanding Evaluation), et standardsett med oppgaver designet for å teste språkforståelse, for eksempel å oppdage parafraser, bedømme om en setning uttrykker positive eller negative følelser, og verbale resonnementer.



Mann biter hund: De fant ut at disse systemene ikke kunne fortelle når ord i en setning ble blandet sammen, selv når den nye rekkefølgen endret betydningen. For eksempel oppdaget systemene riktig at setningene Gir marihuana kreft? og hvordan kan røyking av marihuana gi deg lungekreft? var parafraser. Men de var enda mer sikre på at Du røyker kreft hvordan marihuana lunge kan gi? og lunge kan gi marihuana røyking hvordan du kreft? mente det samme også. Systemene bestemte også at setninger med motsatte betydninger - for eksempel forårsaker marihuana kreft? og forårsaker kreft marihuana? – stilte det samme spørsmålet.

Den eneste oppgaven der ordrekkefølgen betydde noe var en der modellene måtte sjekke den grammatiske strukturen til en setning. Ellers endret ikke mellom 75 % og 90 % av de testede systemenes svar seg når ordene ble blandet.

Hva skjer? Det ser ut til at modellene fanger opp noen få nøkkelord i en setning, uansett hvilken rekkefølge de kommer i. De forstår ikke språk slik vi gjør, og GLUE – en veldig populær målestokk – måler ikke ekte språkbruk. I mange tilfeller tvinger ikke oppgaven en modell er trent på den til å bry seg om ordrekkefølge eller syntaks generelt. Med andre ord, GLUE lærer NLP-modeller å hoppe gjennom bøyler.



Mange forskere har begynt å bruke et hardere sett med tester kalt SuperGLUE, men Nguyen mistenker at det vil ha lignende problemer.

Dette problemet har også blitt identifisert av Yoshua Bengio og kolleger, som fant det endre rekkefølgen på ord i en samtale noen ganger endret ikke svarene chatbotene ga. Og et team fra Facebook AI Research fant eksempler på at dette skjer med kinesisk . Nguyens team viser at problemet er utbredt.

Gjør det noe? Det avhenger av applikasjonen. På den ene siden vil en AI som fortsatt forstår når du skriver en skrivefeil eller sier noe feil, som et annet menneske kunne, være nyttig. Men generelt er ordrekkefølge avgjørende når du skal fjerne en setnings betydning.



fikse det Hvordan? Den gode nyheten er at det kanskje ikke er så vanskelig å fikse. Forskerne fant at å tvinge en modell til å fokusere på ordrekkefølge, ved å trene den til å gjøre en oppgave der ordrekkefølge betydde noe (som å oppdage grammatiske feil), gjorde også at modellen presterte bedre på andre oppgaver. Dette antyder at å justere oppgavene som modellene er opplært til å gjøre, vil gjøre dem bedre totalt sett.

Nguyens resultater er nok et eksempel på hvordan modeller kommer ofte langt til kort av hva folk tror de er i stand til. Han mener det fremhever hvor vanskelig det er å lage AI-er som forstår og resonnerer som mennesker . Ingen har peiling, sier han.

gjemme seg