Facebook ønsker å gjøre AI bedre ved å be folk om å bryte den

Yatheesh Gowda / Pixabay





De eksplosive suksessene til AI det siste tiåret eller så er vanligvis kalkulert til massevis av data og mye datakraft. Men benchmarks spiller også en avgjørende rolle for å drive fremgang – tester som forskere kan sette AI mot for å se hvor avansert den er. For eksempel setter ImageNet, et offentlig datasett med 14 millioner bilder, et mål for bildegjenkjenning. MNIST gjorde det samme for håndskriftgjenkjenning og GLUE (General Language Understanding Evaluation) for naturlig språkbehandling, noe som førte til gjennombrudd språkmodeller som GPT-3 .

Et fast mål blir snart forbigått. ImageNet blir oppdatert og GLUE er erstattet av SuperGLUE, et sett med vanskeligere språklige oppgaver. Likevel vil forskere før eller siden rapportere at deres AI har nådd overmenneskelige nivåer, og overgår folk i denne eller den utfordringen. Og det er et problem hvis vi vil at benchmarks skal fortsette å drive fremgang.

Så Facebook gir ut en ny type test som setter AI-er opp mot mennesker som gjør sitt beste for å snuble dem. Kalt Dynabench , vil testen være så vanskelig som folk velger å gjøre den.



Benchmarks kan være veldig misvisende, sier Douwe Kiela ved Facebook AI Research, som ledet teamet bak verktøyet. Å fokusere for mye på benchmarks kan bety å miste bredere mål av syne. Testen kan bli oppgaven.

Du ender opp med et system som er bedre på testen enn mennesker er, men ikke bedre på den generelle oppgaven, sier han. Det er veldig villedende, fordi det får det til å se ut som om vi er mye lenger enn vi faktisk er.

Kiela mener det er et spesielt problem med NLP akkurat nå. En språkmodell som GPT-3 fremstår som intelligent fordi den er så god til å etterligne språk. Men det er vanskelig å si hvor mye disse systemene faktisk forstår.



Tenk på å prøve å måle menneskelig intelligens, sier han. Du kan gi folk IQ-tester, men det forteller deg ikke om de virkelig forstår et emne. For å gjøre det må du snakke med dem, stille spørsmål.

Dynabench gjør noe lignende, og bruker folk til å forhøre AI-er. Utgitt på nett i dag, inviterer den folk til å gå til nettstedet og spørre om modellene bak. Du kan for eksempel gi en språkmodell en Wikipedia-side og deretter stille den spørsmål, og gi den en poengsum for svarene.

På noen måter ligner ideen på måten folk allerede spiller med GPT-3, tester grensene, eller måten chatboter blir evaluert for Loebner-prisen, en konkurranse der roboter prøver å bestå som mennesker. Men med Dynabench vil feil som dukker opp under testing automatisk bli matet tilbake til fremtidige modeller, noe som gjør dem bedre hele tiden.



Foreløpig vil Dynabench fokusere på språkmodeller fordi de er en av de enkleste typene AI for mennesker å samhandle med. Alle snakker et språk, sier Kiela. Du trenger ingen reell kunnskap om hvordan du bryter disse modellene.

Men tilnærmingen bør også fungere for andre typer nevrale nettverk, for eksempel tale- eller bildegjenkjenningssystemer. Du trenger bare en måte for folk å laste opp sine egne bilder – eller få dem til å tegne ting – for å teste det, sier Kiela: Den langsiktige visjonen for dette er å åpne det opp slik at hvem som helst kan spinne opp sin egen modell og begynne å samle inn sine egne data.

Vi ønsker å overbevise AI-fellesskapet om at det er en bedre måte å måle fremgang på, legger han til. Forhåpentligvis vil det resultere i raskere fremgang og en bedre forståelse av hvorfor maskinlæringsmodeller fortsatt mislykkes.



gjemme seg