211service.com
Det er lett å skli giftig språk forbi Alphabets giftkommentardetektor
På torsdag ga Alphabet ut en maskinlæringsbasert tjeneste, kalt Perspective, beregnet på å identifisere giftige kommentarer på nettsteder. Det er fra Jigsaw, en enhet som jobber med teknologier for å gjøre Internett til et tryggere og mer sivilt sted. Men da jeg lekte med Perspective, var resultatene uberegnelige.
Perspektiv vurderer kommentarer på en skala fra 1 til 100 for toksisitet, definert som en frekk, respektløs eller urimelig kommentar som sannsynligvis vil få deg til å forlate en diskusjon. Screw you, Trump-supportere vurderes til å være svært giftig, mens jeg ærlig støtter at begge ikke er det, for eksempel. Men Perspective har problemer med å oppdage følelsen bak en kommentar – et problem jeg spådde ville plage Jigsaw da jeg undersøkte ambisjonene i desember (se If Only AI Could Save Us From Ourselves ).
Trump suger scoret kolossale 96 prosent, men nynazistisk kodeord 14/88 fikk bare 5 prosent. Få muslimer er en terrortrussel var 79 prosent giftig, mens rasekrig nå scoret 24 prosent. Hitler var en antisemitt scoret 70 prosent, men Hitler var ikke en antisemitt scoret bare 53%, og Holocaust skjedde aldri fikk bare 21%. Og mens gas the joos scoret 29 prosent, omformulerer det til Please gas the joos. Takk skal du ha. senket poengsummen til bare 7 prosent. (Jøder er mennesker, men scorer 72 prosent. Jøder er ikke mennesker? 64 prosent.)
I følge Jigsaw ble Perspective opplært til å oppdage toksisitet ved å bruke hundretusenvis av kommentarer rangert av menneskelige anmeldere. Resultatet ser ut til å være et system som er sensibilisert for bestemte ord og uttrykk – men ikke for betydninger.
Ordet voldtekt, for eksempel, scorer 77 prosent alene – kanskje forklarer hvorfor voldtekt er en fryktelig forbrytelse, scorer 81 prosent. (Et lignende mønster sees med banning: Jeg elsker dette scorer 94 prosent.)
På samme måte forårsaker negasjoner og andre nyanser av språket paradoksale resultater. Legge til en ikke å skape Få muslimer er ikke en terrortrussel senker toksisiteten fra 79 prosent til 60 prosent fordi ikke en terrortrussel virker mer ufarlig for Perspektiv, selv om den tiltenkte meningen blir mer giftig.
Som jeg bemerket i mitt forrige stykke om Jigsaw, tillater ikke den nåværende tilstanden for maskinlæring programvare å forstå intensjonen og konteksten til kommentarer. Ved å gjøre mønstertilpasning på overflatenivå, kan Conversation AI kanskje filtrere stilistisk— men ikke semantisk .
Det gjør ikke teknologien ubrukelig. Et system som Perspective kan fremskynde arbeidet til moderatorer ved å flagge ekstreme tilfeller. Det er fornuftig at New York Times samarbeider med Jigsaw for å gi moderatorene hjelp med politikommentarer til artikler. De New York Times har imidlertid ikke et misbruksproblem; den søker å identifisere kommentarer av høy kvalitet, der stilistisk matching sannsynligvis vil være mer effektiv. Når det gjelder forsettlig misbruk, vil Jigsaws programvare ikke kunne erstatte menneskelig dømmekraft i tvetydige saker.
Vi kan si at troll er dumme (toksisitetsscore 96 prosent), men språket for toksisitet og trakassering er ofte rikt på måter som maskinlæringssystemer ikke kan håndtere. Kommentaren Du bør gjøres til en lampe, en hentydning til påstander om at hud fra konsentrasjonsleirofre ble brukt til lampeskjermer, har blitt kastet mot en rekke journalister og andre offentlige personer de siste månedene. Den scorer bare 4 prosent på Perspektiv. Men det er best å ikke svare med å si at du er nazist, for det er 87 prosent.