Facebook hevder sin nye chatbot slår Googles som den beste i verden





Til tross for all fremgangen som chatboter og virtuelle assistenter har gjort, er de fortsatt forferdelige samtalepartnere. De fleste er svært oppgaveorienterte: du stiller krav og de etterkommer. Noen er svært frustrerende: de ser aldri ut til å få det du leter etter. Andre er forferdelig kjedelige: de mangler sjarmen til en menneskelig følgesvenn. Det er greit når du bare ønsker å stille inn en tidtaker. Men etter hvert som disse robotene blir stadig mer populære som grensesnitt for alt fra detaljhandel til helsetjenester til finansielle tjenester, blir mangelen bare mer tydelig.

Nå har Facebook åpnet en ny chatbot at den hevder kan snakke om nesten alt på en engasjerende og interessant måte. Blender kunne ikke bare hjelpe virtuelle assistenter med å løse mange av sine mangler, men også markere fremskritt mot den større ambisjonen som driver mye av AI-forskningen: å replikere intelligens. Dialog er på en måte et 'AI-komplett'-problem, sier Stephen Roller, en forskningsingeniør hos Facebook som ledet prosjektet. Du må løse hele AI for å løse dialog, og hvis du løser dialog, har du løst hele AI.

Blenders evne kommer fra det enorme omfanget av treningsdataene. Den ble først trent på 1,5 milliarder offentlig tilgjengelige Reddit-samtaler, for å gi den et grunnlag for å generere svar i en dialog. Den ble deretter finjustert med flere datasett for hver av tre ferdigheter: samtaler som inneholdt en slags følelser , for å lære den empati (hvis en bruker sier at jeg har fått en forfremmelse, for eksempel, kan den si Gratulerer!); informasjonsrike samtaler med en ekspert for å lære den kunnskap; og samtaler mellom mennesker med distinkte personligheter , for å lære den personlighet. Den resulterende modellen er 3,6 ganger større enn Googles chatbot Meena , som ble annonsert i januar – så stor at den ikke kan passe på en enkelt enhet og må kjøre over to databrikker i stedet.



Facebook Blender chat-logg

Et eksempel på en samtale mellom et menneske og Blender.

FACEBOOK

På den tiden proklamerte Google at Meena var den beste chatboten i verden. I Facebooks egne tester fant imidlertid 75 % av menneskelige evaluatorer Blender mer engasjerende enn Meena, og 67 % syntes det hørtes mer ut som et menneske. Chatboten lurte også menneskelige evaluatorer 49 % av tiden til å tro at samtaleloggene var mer menneskelige enn samtaleloggene mellom ekte mennesker – noe som betyr at det ikke var mye av en kvalitativ forskjell mellom de to. Google hadde ikke svart på en forespørsel om kommentar da denne historien skulle publiseres.

Til tross for disse imponerende resultatene, er imidlertid Blenders ferdigheter fortsatt ikke i nærheten av et menneskes. Så langt har teamet evaluert chatboten kun på korte samtaler med 14 svinger. Hvis det fortsatte å chatte lenger, mistenker forskerne, ville det snart slutte å gi mening. Disse modellene er ikke i stand til å gå i dybden, sier Emily Dinan, den andre prosjektlederen. De er ikke i stand til å huske samtalehistorie utover noen få svinger.



Blender har også en tendens til å hallusinere kunnskap, eller finne på fakta – en direkte begrensning av dyplæringsteknikkene som brukes til å bygge den. Det genererer til slutt setningene sine fra statistiske korrelasjoner i stedet for en database med kunnskap. Som et resultat kan den sette sammen en detaljert og sammenhengende beskrivelse av en kjent kjendis, for eksempel, men med fullstendig falsk informasjon. Teamet planlegger å eksperimentere med å integrere en kunnskapsdatabase i chatbotens svargenerering.

Facebook Blender-evaluering

Menneskelige evaluatorer sammenlignet samtaler med flere svinger med forskjellige chatboter.

FACEBOOK

En annen stor utfordring med ethvert åpent chatbot-system er å forhindre at det sier giftige eller partiske ting. Fordi slike systemer til syvende og sist blir trent på sosiale medier, kan de ende opp med å sette opp vitriolen på internett. (Dette skjedde beryktet Microsofts chatbot Tay i 2016.) Teamet prøvde å løse dette problemet ved å be crowdworkers om å filtrere ut skadelig språk fra de tre datasettene som ble brukt til finjustering, men det gjorde ikke det samme for Reddit-datasettet på grunn av størrelsen. (Alle som har brukt mye tid på Reddit vil vite hvorfor det kan være problematisk.)



Teamet håper å eksperimentere med bedre sikkerhetsmekanismer, inkludert en giftig språkklassifisering som kan dobbeltsjekke chatbotens svar. Forskerne innrømmer imidlertid at denne tilnærmingen ikke vil være omfattende. Noen ganger kan en setning som Ja, det er flott virke greit, men innenfor en sensitiv kontekst, for eksempel som svar på en rasistisk kommentar, kan den få skadelige betydninger.

På lang sikt er Facebook AI-teamet også interessert i å utvikle mer sofistikerte samtaleagenter som kan svare på visuelle signaler så vel som bare ord. Et prosjekt er å utvikle et system kalt Image Chat, for eksempel, som kan snakke fornuftig og med personlighet om bildene en bruker kan sende.

gjemme seg