211service.com
Hvordan dataene våre koder for systematisk rasisme
Ms Tech
Jeg har ofte blitt fortalt at dataene ikke lyver. Det har imidlertid aldri vært min erfaring. For meg lyver dataene nesten alltid. Googles bildesøkeresultater for sunn hud viser kun lyshudede kvinner, og et søk på Svarte jenter returnerer fortsatt pornografi . De CelebA ansiktsdatasettet har etiketter med stor nese og store lepper som er uforholdsmessig tildelt mørkere kvinnelige ansikter som mine. Etikett for ImageNet-trente modeller jeg er en dårlig person, en narkoman eller en fiasko. Datasett for å oppdage hudkreft mangler prøver av mørkere hudtyper.
Hvit overherredømme vises ofte voldelig - i skudd mot en overfylt Walmart eller kirketjeneste , i den skarpe bemerkningen om en hat-drevet anklage eller et grovt dytt på gaten – men noen ganger tar det en mer subtil form, som disse løgnene. Når de av oss som bygger AI-systemer fortsetter å la den åpenbare løgnen om hvit overherredømme være innebygd i alt fra hvordan vi samler inn data til hvordan vi definerer datasett og hvordan vi velger å bruke dem, betyr det en urovekkende toleranse.
Ikke-hvite mennesker er ikke uteliggere. Globalt er vi norm , og dette ser ikke ut til å være det endres når som helst snart . Datasett som er så spesifikt innebygd i og for hvite områder, representerer den konstruerte virkeligheten, ikke den naturlige. Å ha nøyaktighet beregnet i fravær av min levde erfaring støter meg ikke bare, men setter meg også i reell fare.
Korrupte data
I en forskningsartikkel med tittelen Skitne data, dårlige spådommer , beskriver hovedforfatter Rashida Richardson et alarmerende scenario: politidistrikter mistenkt eller bekreftet å ha engasjert seg i korrupte, rasistisk partiske eller på annen måte ulovlig praksis fortsetter å bidra med dataene sine til utviklingen av nye automatiserte systemer som er ment å hjelpe tjenestemenn med å ta politiavgjørelser.
Målet med prediktive politiverktøy er å sende offiserer til åstedet for en forbrytelse før det skjer. Antakelsen er at steder hvor personer tidligere har blitt arrestert, korrelerer med sannsynligheten for fremtidig ulovlig aktivitet. Det Richardson påpeker er at denne antakelsen forblir ubestridt selv når de første arrestasjonene var rasistisk motiverte eller ulovlige, noen ganger involverte systemisk datamanipulasjon, politikorrupsjon, forfalskning av politirapporter og vold, inkludert raning av innbyggere, plante bevis, utpressing, grunnlovsstridige søk og annen korrupt praksis. Til og med data fra de verst oppførte politiavdelingene er det brukes fortsatt til å informere prediktivt politiverktøy .
Som Det melder Tampa Bay Times , kan denne tilnærmingen gi algoritmisk begrunnelse for ytterligere polititrakassering av minoritets- og lavinntektssamfunn. Å bruke slike feilaktige data for å trene opp nye systemer, bygger inn politiavdelingens dokumenterte feil oppførsel i algoritmen og opprettholder praksis som allerede er kjent for å terrorisere de som er mest sårbare for dette overgrepet.
Dette kan se ut til å beskrive en håndfull tragiske situasjoner. Imidlertid er det virkelig normen innen maskinlæring: dette er den typiske kvaliteten på dataene vi for øyeblikket aksepterer som vår ubestridte grunnsannhet.
Relatert historie
Hva mangler i bedriftens uttalelser om rasemessig urettferdighet? Den egentlige årsaken til rasisme. En analyse av 63 nylige uttalelser viser at amerikanske teknologiselskaper gjentatte ganger la ansvaret for rasemessig urett på svarte mennesker.En dag GPT-2, en tidligere offentlig tilgjengelig versjon av automatisert språkgenereringsmodell utviklet av forskningsorganisasjonen OpenAI, begynte å snakke åpent med meg om hvite rettigheter. Gitt enkle spørsmål som en hvit mann er eller en svart kvinne, ville teksten modellen genererte lansere i diskusjoner om hvite ariske nasjoner og utenlandske og ikke-hvite inntrengere.
Ikke bare inkluderte disse utsagn grufulle utsagn som tispe, tøs, nigger, chink og slanteye,' men den genererte teksten legemliggjorde en spesifikk amerikansk hvit nasjonalistisk retorikk, som beskrev demografiske trusler og gikk over til antisemittiske sider mot jøder og kommunister.
GPT-2 tenker ikke selv – den genererer svar ved å replikere språkmønstre observert i dataene som brukes til å utvikle modellen. Dette datasettet, kalt WebText, inneholder over 8 millioner dokumenter for totalt 40 GB tekst hentet fra hyperkoblinger. Disse lenkene ble selv valgt fra innlegg som ble mest stemt opp på nettstedet Reddit for sosiale medier, som en heuristisk indikator for om andre brukere syntes lenken var interessant, lærerik eller bare morsom .
Men Reddit-brukere – inkludert de som laster opp og stemmer opp – er det kjent for å inkludere hvite supremacister . I årevis var plattformen full av rasistisk språkbruk og tillatte lenker til innhold som uttrykker rasistisk ideologi. Og selv om det finnes praktiske alternativer tilgjengelig å dempe denne oppførselen på plattformen, de første seriøse forsøkene på Gjør noe , av daværende administrerende direktør Ellen Pao i 2015, ble dårlig mottatt av samfunnet og førte til intense trakassering og tilbakeslag .
Enten de har å gjøre med villfarne politimenn eller villfarne brukere, velger teknologer å la dette spesielle undertrykkende verdensbildet stivne i datasett og definere naturen til modellene vi utvikler. OpenAI selv erkjente begrensningene ved å hente data fra Reddit, og bemerket det mange ondsinnede grupper bruker disse diskusjonsforumene til å organisere . Men organisasjonen også fortsetter å bruke det Reddit-avledede datasettet , selv i påfølgende versjoner av språkmodellen. Den farlige feilen til datakilder avvises i praksis for enkelhets skyld, til tross for konsekvensene. Ondsinnede hensikter er ikke nødvendig for at dette skal skje, selv om en viss tankeløs passivitet og omsorgssvikt er det.
Små hvite løgner
Hvit overherredømme er den falske troen på at hvite individer er overlegne i forhold til andre raser. Det er ikke en enkel misforståelse, men en ideologi forankret i bedrag . Rase er den første myten, overlegenhet den neste. Tilhengere av denne ideologien klamrer seg hardnakket til en oppfinnelse som privilegerer dem.
Jeg hører hvordan denne løgnen myker opp språket fra en krig mot narkotika til en opioidepidemi , og skylder på mental helse eller videospill for handlingene til hvite overfallsmenn, selv som det attributter latskap og kriminalitet til ikke-hvite ofre. Jeg legger merke til hvordan det sletter de som ser ut som meg, og jeg ser det spille ut i en endeløs parade av bleke ansikter som jeg ikke ser ut til å unnslippe – på film, på magasinforsider og på prisutdelinger.
Datasett som er så spesifikt innebygd i og for hvite områder, representerer den konstruerte virkeligheten, ikke den naturlige.
Denne skyggen følger hver gang jeg beveger meg, en ubehagelig frysning i nakken. Når jeg hører drap, ser jeg ikke bare politimannen med kneet på en hals eller misforstått årvåken med en pistol ved hans side - det er økonomi som kveler oss, den sykdom som svekkes oss, og regjeringen som tyster oss.
Fortell meg – hva er forskjellen mellom overpolitisering i minoritetsområder og partiskheten til algoritmen som sendte offiserer dit ? Hva er forskjellen mellom et segregert skolesystem og et diskriminerende graderingsalgoritme ? Mellom en lege som ikke lytter og en algoritme som nekter deg en sykehusseng ? Det er ingen systematisk rasisme atskilt fra våre algoritmiske bidrag, fra det skjulte nettverket av algoritmiske distribusjoner som regelmessig kollapser på de som allerede er mest sårbare.
Motstå teknologisk determinisme
Teknologi er ikke uavhengig av oss; den er laget av oss, og vi har full kontroll over den. Data er ikke bare vilkårlig politisk – Det er spesifikk giftig og feilinformert politikk som dataforskere uforsiktig lar infiltrere datasettene våre. Hvit overherredømme er en av dem.
Vi har allerede satt oss selv og våre beslutninger inn i resultatet – det er ingen nøytral tilnærming. Det er ingen fremtidig versjon av data som er magisk objektiv. Data vil alltid være en subjektiv tolkning av noens virkelighet, en spesifikk presentasjon av målene og perspektivene vi velger å prioritere i dette øyeblikket. Det er en makt som innehas av de av oss som er ansvarlige for å skaffe, velge og utforme disse dataene og utvikle modellene som tolker informasjonen. I hovedsak er det ingen utveksling av rettferdighet for nøyaktighet - det er et mytisk offer, en unnskyldning for ikke å stå på vår rolle i å definere ytelse ved ekskludering av andre i utgangspunktet.
De av oss som bygger disse systemene vil velge hvilke subreddits og nettkilder for å gjennomgå , hvilken språk til bruk eller ignorer, hvilke datasett til fjerne eller godta . Viktigst, vi velge hvem vi bruker disse algoritmene til , og hvilke mål vi optimaliserer til. Vi velger etikettene vi lager, dataene vi tar inn, metodene vi bruker. Vi velger hvem vi ønsker velkommen som datavitere og ingeniører og forskere – og hvem vi gjør ikke . Det var mange muligheter for utformingen av teknologien vi bygget, og vi valgte denne. Vi er ansvarlige.
Så hvorfor kan vi ikke være mer forsiktige? Når vil vi endelig få en vane med å avsløre data herkomst , sletting av problematiske datasett , og eksplisitt definere begrensninger for hver modells omfang ? På hvilket tidspunkt kan vi fordømme de som opererer med en eksplisitt hvit overherredømme agenda , og ta alvorlige handlinger for inkludering?
En usikker vei videre
Distrahert av bedriftens kondolanser , abstrakte tekniske løsninger og artikulerte sosiale teorier, har jeg sett jevnaldrende gratulere seg selv med usynlig fremgang. Til syvende og sist misunner jeg dem, fordi de har et valg i samme verden der jeg, som alle andre svarte personer, ikke kan velge bort å bry meg om dette.
Ettersom svarte mennesker nå dør i en kakofoni av naturkatastrofer og unaturlige katastrofer, er mange av kollegene mine fortsatt mer oppslukt av det siste produktet eller romoppskytingen enn den skurrende redselen til en virkelighet som tar pusten ut av meg.
Faktum er at AI ikke fungerer før det fungerer for oss alle.
I årevis har jeg sett dette problemet fremhevet som viktig, men det er klart at det å håndtere det fortsatt blir sett på som en ikke-prioritert, hyggelig å ha supplerende handling – alltid sekundært til en eller annen definisjon av modellfunksjonalitet som ikke inkluderer meg.
Modeller som tydeligvis fortsatt sliter med å takle disse skjevhetsutfordringene får feiret som gjennombrudd , mens folk er modige nok til å snakke om risikoen bli stille, eller verre . Det er en tydelig kulturell selvtilfredshet med ting som vanlig, og selv om det er skuffende, er det ikke spesielt overraskende i et felt der det store flertallet bare ikke forstår innsatsen.
Faktum er at AI ikke fungerer før det fungerer for oss alle. Hvis vi håper å noen gang ta tak i rasemessig urettferdighet, må vi slutte å presentere våre forvrengte data som grunnsannhet. Det er ingen rasjonell og rettferdig verden der ansettelsesverktøy utelukker systematisk kvinner fra tekniske roller, eller hvor selvkjørende biler er mer sannsynlig å treffe fotgjengere med mørkere hud . Sannheten til enhver virkelighet jeg kjenner igjen er ikke i disse modellene, eller i datasettene som informerer dem.
Maskinlæringssamfunnet fortsetter å akseptere et visst nivå av dysfunksjon så lenge bare visse grupper er berørt. Dette krever bevisst endring, og det vil kreve like mye innsats som enhver annen kamp mot systematisk undertrykkelse. Tross alt er løgnene innebygd i dataene våre ikke mye forskjellig fra noen annen løgn som hvit overherredømme har fortalt. De vil dermed kreve like mye energi og investeringer for å motvirke.
Deborah Raji er en Mozilla-stipendiat som er interessert i algoritmisk revisjon og evaluering. Hun har jobbet med flere prisvinnende prosjekter for å synliggjøre tilfeller av skjevheter i datasyn og forbedre dokumentasjonspraksis innen maskinlæring.