211service.com
En AI for å generere falske nyheter kan også bidra til å oppdage det
Hendrik Strobelt og Sebastian Gehrmann
Forrige måned tilbakeholdt OpenAI ganske dramatisk utgivelsen av sin nyeste språkmodell, GPT-2, fordi de fryktet at den kunne brukes til å automatisere masseproduksjonen av feilinformasjon. Avgjørelsen akselererte også AI-fellesskapets pågående diskusjon om hvordan man oppdager denne typen falske nyheter. I en ny eksperiment , vurderte forskere ved MIT-IBM Watson AI Lab og HarvardNLP om de samme språkmodellene som kan skrive en slik overbevisende prosa også kan oppdage andre modellgenererte passasjer.
Tanken bak denne hypotesen er enkel: språkmodeller produserer setninger ved å forutsi neste ord i en tekstsekvens. Så hvis de enkelt kan forutsi de fleste ordene i en gitt passasje, er det sannsynlig at den ble skrevet av en av deres egne.
Forskerne testet ideen deres ved å bygge en interaktivt verktøy basert på den offentlig tilgjengelige nedgraderte versjonen av OpenAIs GPT-2. Når du mater verktøyet med et tekststykke, fremhever det ordene i grønt, gult eller rødt for å indikere avtagende forutsigbarhet; den fremhever dem i lilla hvis den ikke ville ha spådd dem i det hele tatt. I teorien, jo høyere brøkdel av røde og lilla ord, jo større er sjansen for at passasjen ble skrevet av et menneske; jo større andel grønne og gule ord, jo mer sannsynlig er det skrevet av en språkmodell.

En leseforståelse fra en amerikansk standardisert test, skrevet av et menneske. Hendrik Strobelt og Sebastian Gehrmann

En passasje skrevet av OpenAIs nedgraderte GPT-2. Hendrik Strobelt og Sebastian Gehrmann
Forskerne fant faktisk at passasjer skrevet av de nedgraderte og fullversjonene av GPT-2 kom ut nesten helt grønne og gule, mens vitenskapelige sammendrag skrevet av mennesker og tekst fra leseforståelsespassasjer i amerikanske standardiserte tester hadde mye rødt og lilla.
Men ikke så fort. Janelle Shane, en forsker som driver den populære bloggen La nevrale nettverk være rare og som ikke var involvert i den innledende forskningen, satte verktøyet til en mer streng test . I stedet for bare å mate den med tekst generert av GPT-2, matet hun den med passasjer skrevet av andre språkmodeller også, inkludert en trent på Amazon-anmeldelser og en annen trent på Dungeons and Dragons-biografier. Hun fant ut at verktøyet ikke klarte å forutsi en stor del av ordene i hver av disse passasjene, og derfor antok det at de var menneskeskrevne. Dette identifiserer en viktig innsikt: en språkmodell kan være god til å oppdage sin egen utgang, men ikke nødvendigvis utgangen fra andre.
Denne historien dukket opprinnelig opp i vårt AI-nyhetsbrev The Algorithm. For å få den levert direkte til innboksen din, registrer deg her gratis.