211service.com
Hvordan vores data koder for systematisk racisme
Ms Tech
Jeg har ofte fået at vide: Dataene lyver ikke. Det har dog aldrig været min oplevelse. For mig ligger data næsten altid. Google billedsøgeresultater for sund hud viser kun lyshudede kvinder og en forespørgsel på Sorte piger returnerer stadig pornografi . Det CelebA ansigtsdatasættet har etiketter med stor næse og store læber, der er uforholdsmæssigt tildelt mørkere kvindelige ansigter som mine. Etiket af ImageNet-uddannede modeller mig et dårligt menneske, en stofmisbruger eller en fiasko. Datasæt til påvisning af hudkræft mangler prøver af mørkere hudtyper.
Hvid overherredømme optræder ofte voldsomt - i skud mod en overfyldt Walmart eller gudstjeneste , i den skarpe bemærkning om en hadedrevet anklage eller et groft skub på gaden - men nogle gange tager det en mere subtil form, som disse løgne. Når de af os, der bygger AI-systemer, fortsætter med at tillade den åbenlyse løgn om hvid overherredømme at blive indlejret i alt fra hvordan vi indsamler data til hvordan vi definerer datasæt og hvordan vi vælger at bruge dem, betyder det en foruroligende tolerance.
Ikke-hvide mennesker er ikke outliers. Globalt set er vi norm , og det ser det ikke ud til at være ændres når som helst snart . Datasæt så specifikt indbygget i og for hvide rum repræsenterer den konstruerede virkelighed, ikke den naturlige. At få beregnet nøjagtighed i fravær af min levede erfaring støder mig ikke kun, men sætter mig også i reel fare.
Korrupte data
I en forskningsartikel med titlen Beskidte data, dårlige forudsigelser , beskriver hovedforfatteren Rashida Richardson et alarmerende scenarie: politidistrikter, der mistænkes eller bekræftes for at have deltaget i korrupte, racemæssige eller på anden måde ulovlige praksisser, fortsætter med at bidrage med deres data til udviklingen af nye automatiserede systemer, der er beregnet til at hjælpe betjente med at træffe politimæssige beslutninger.
Målet med prædiktive politiværktøjer er at sende betjente til stedet for en forbrydelse, før den sker. Antagelsen er, at steder, hvor personer tidligere var blevet anholdt, korrelerer med en sandsynlighed for fremtidig ulovlig aktivitet. Hvad Richardson påpeger, er, at denne antagelse forbliver ubestridt, selv når disse første anholdelser var racistisk motiverede eller ulovlige, nogle gange involverede systemisk datamanipulation, politikorruption, forfalskning af politirapporter og vold, herunder røveri af beboere, plantning af bevismateriale, afpresning, forfatningsstridige ransagninger og anden korrupt praksis. Selv data fra de værst opførte politiafdelinger er stadig bruges til at informere prædiktive politiværktøjer .
Som Det skriver Tampa Bay Times , kan denne tilgang give en algoritmisk begrundelse for yderligere politichikane af minoritets- og lavindkomstsamfund. Brug af sådanne fejlbehæftede data til at træne nye systemer indlejrer politiafdelingens dokumenterede uredelighed i algoritmen og viderefører praksis, der allerede er kendt for at terrorisere dem, der er mest sårbare over for dette misbrug.
Dette kan synes at beskrive en håndfuld tragiske situationer. Men det er virkelig normen inden for maskinlæring: dette er den typiske kvalitet af de data, vi i øjeblikket accepterer som vores ubestridte sandhed.
Relateret historie
Hvad mangler der i virksomhedernes udtalelser om racemæssig uretfærdighed? Den egentlige årsag til racisme. En analyse af 63 nylige udtalelser viser, at amerikanske teknologivirksomheder gentagne gange har lagt ansvaret for racemæssig uretfærdighed på sorte mennesker.En dag GPT-2, en tidligere offentligt tilgængelig version af automatiseret sproggenereringsmodel udviklet af forskningsorganisationen OpenAI, begyndte at tale åbent med mig om hvide rettigheder. Givet enkle anvisninger, som en hvid mand er eller en sort kvinde, ville den tekst, som modellen genererede, lancere i diskussioner om hvide ariske nationer og udenlandske og ikke-hvide angribere.
Ikke alene omfattede disse rædselsvækkende rædselsvækkende bagtalelser som tæve, tøs, nigger, chink og slanteye,' men den genererede tekst legemliggjorde en specifik amerikansk hvid nationalistisk retorik, der beskrev demografiske trusler og vendte ind i antisemitiske sider mod jøder og kommunister.
GPT-2 tænker ikke selv - den genererer svar ved at replikere sprogmønstre observeret i de data, der bruges til at udvikle modellen. Dette datasæt, kaldet WebText, indeholder over 8 millioner dokumenter til i alt 40 GB tekst hentet fra hyperlinks. Disse links blev selv udvalgt blandt de mest opstemte indlæg på det sociale medie-websted Reddit, som en heuristisk indikator for, om andre brugere fandt linket interessant, lærerigt eller bare sjovt .
Men Reddit-brugere - inklusive dem, der uploader og opretter - er det kendt for at omfatte hvide supremacister . I årevis var platformen fyldt med racistisk sprogbrug og tilladte links til indhold, der udtrykker racistisk ideologi. Og selvom der er praktiske muligheder at bremse denne adfærd på platformen, de første seriøse forsøg på at handle , af daværende administrerende direktør Ellen Pao i 2015, blev dårligt modtaget af samfundet og førte til intense chikane og modreaktioner .
Uanset om det drejer sig om egensindige betjente eller egensindige brugere, vælger teknologer at lade dette særlige undertrykkende verdensbillede størkne i datasæt og definere arten af modeller, som vi udvikler. OpenAI selv anerkendte begrænsningerne ved at hente data fra Reddit og bemærkede det mange ondsindede grupper bruger disse diskussionsfora til at organisere . Men organisationen også fortsætter med at gøre brug af det Reddit-afledte datasæt , selv i efterfølgende versioner af dens sprogmodel. Datakildernes farligt fejlbehæftede karakter afvises effektivt for nemheds skyld på trods af konsekvenserne. Ondsindede hensigter er ikke nødvendige for at dette kan ske, selvom en vis utænksom passivitet og omsorgssvigt er det.
Små hvide løgne
Hvid overherredømme er den falske tro på, at hvide individer er overlegne i forhold til andre racer. Det er ikke en simpel misforståelse, men en ideologi med rod i bedrag . Race er den første myte, overlegenhed den næste. Tilhængere af denne ideologi holder stædigt fast ved en opfindelse, der privilegerer dem.
Jeg hører, hvordan denne løgn blødgør sproget fra en krig mod stoffer til en opioidepidemi , og giver skylden mental sundhed eller videospil for hvide overfaldsmænds handlinger, selv som det tilskriver det dovenskab og kriminalitet til ikke-hvide ofre. Jeg bemærker, hvordan det sletter dem, der ligner mig, og jeg ser det udspille sig i en endeløs parade af blege ansigter, som jeg ikke kan undslippe – på film, på magasinforsider og til prisuddelinger.
Datasæt så specifikt indbygget i og for hvide rum repræsenterer den konstruerede virkelighed, ikke den naturlige.
Denne skygge følger alle mine bevægelser, en ubehagelig kuldegysning i nakken. Når jeg hører mord, ser jeg ikke bare politibetjenten med hans knæ på en hals eller den misforstået årvågen med en pistol ved hans side - det er økonomi, der kvæler os, den sygdom, der svækkes os, og regeringen, der tier os.
Fortæl mig – hvad er forskellen mellem overpoliti i minoritetskvarterer og partiskhed i algoritmen, der sendte betjente dertil ? Hvad er forskellen mellem et adskilt skolesystem og et diskriminerende bedømmelsesalgoritme ? Mellem en læge, der ikke lytter og en algoritme, der nægter dig en hospitalsseng ? Der er ingen systematisk racisme adskilt fra vores algoritmiske bidrag, fra det skjulte netværk af algoritmiske implementeringer, der jævnligt kollapser på dem, der allerede er mest sårbare.
Modstå teknologisk determinisme
Teknologi er ikke uafhængig af os; det er skabt af os, og vi har fuldstændig kontrol over det. Data er ikke kun vilkårligt politisk — Der er specifik giftig og misinformeret politik, som dataforskere skødesløst tillader at infiltrere vores datasæt. Hvid overherredømme er en af dem.
Vi har allerede indsat os selv og vores beslutninger i resultatet - der er ingen neutral tilgang. Der er ingen fremtidig version af data, der er magisk upartisk. Data vil altid være en subjektiv fortolkning af nogens virkelighed, en specifik præsentation af de mål og perspektiver, vi vælger at prioritere i dette øjeblik. Det er en magt, som ligger hos dem af os, der er ansvarlige for at indkøbe, udvælge og designe disse data og udvikle de modeller, der fortolker informationen. Grundlæggende er der ingen udveksling af retfærdighed for nøjagtighed - det er et mytisk offer, en undskyldning for ikke at stå bag vores rolle i at definere præstationer ved udelukkelse af andre i første omgang.
De af os, der bygger disse systemer, vil vælge hvilke subreddits og onlinekilder til at gennemgå , hvilken sprog til bruge eller ignorere, hvilke datasæt til fjerne eller acceptere . Vigtigst, vi vælge, hvem vi anvender disse algoritmer til , og hvilke mål vi optimerer til. Vi vælger de etiketter, vi opretter, de data, vi tager ind, de metoder, vi bruger. Vi vælger, hvem vi byder velkommen som dataforskere og ingeniører og forskere – og hvem vi gør ikke . Der var mange muligheder for designet af den teknologi, vi byggede, og vi valgte denne. Vi er ansvarlige.
Så hvorfor kan vi ikke være mere forsigtige? Hvornår vil vi endelig få en vane med at afsløre data herkomst , sletning af problematiske datasæt , og eksplicit definere begrænsninger af enhver models omfang ? På hvilket tidspunkt kan vi fordømme dem, der opererer med en eksplicit hvid overherredømme dagsorden , og tag alvorlige handlinger til inklusion?
En usikker vej frem
Distraheret af virksomhedens kondolence , abstrakte tekniske løsninger og formulerede sociale teorier, har jeg set jævnaldrende lykønske sig selv med usynlige fremskridt. I sidste ende misunder jeg dem, fordi de har et valg i den samme verden, hvor jeg, som enhver anden sort person, ikke kan fravælge at bekymre mig om dette.
Da sorte mennesker nu dør i en kakofoni af naturkatastrofer og unaturlige katastrofer, er mange af mine kolleger stadig mere opmuntrede af det seneste produkt eller rumopsendelse end den skurrende rædsel ved en virkelighed, der kvæler åndedrættet ud af mig.
Faktum er, at AI ikke virker, før det virker for os alle.
I årevis har jeg set dette problem hyldet som vigtigt, men det er klart, at håndteringen af det stadig ses som en ikke-prioriteret, rart at have supplerende handling - altid sekundært til en eller anden definition af modelfunktionalitet, der ikke inkluderer mig.
Modeller, der tydeligvis stadig kæmper for at løse disse bias-udfordringer, får fejret som gennembrud , mens folk er modige nok til at tale op om risikoen blive tavs, eller værre . Der er en klar kulturel selvtilfredshed med tingene som sædvanligt, og selvom det er skuffende, er det ikke specielt overraskende på et felt, hvor langt de fleste bare ikke forstår indsatsen.
Faktum er, at AI ikke virker, før det virker for os alle. Hvis vi håber på nogensinde at adressere racemæssig uretfærdighed, så er vi nødt til at stoppe med at præsentere vores forvrængede data som sandhed. Der er ingen rationel og retfærdig verden i at ansætte værktøjer systematisk udelukker kvinder fra tekniske roller, eller hvor selvkørende biler er mere tilbøjelige til at ramme fodgængere med mørkere hud . Sandheden om enhver virkelighed, jeg genkender, er ikke i disse modeller eller i de datasæt, der informerer dem.
Maskinlæringssamfundet fortsætter med at acceptere et vist niveau af dysfunktion, så længe kun visse grupper er berørt. Dette kræver bevidst forandring, og det vil kræve lige så meget indsats som enhver anden kamp mod systematisk undertrykkelse. Når alt kommer til alt, er løgnene indlejret i vores data ikke meget forskellige fra enhver anden løgn, hvid overherredømme har fortalt. De vil således kræve lige så meget energi og investeringer at modvirke.
Deborah Raji er en Mozilla-stipendiat, der er interesseret i algoritmisk revision og evaluering. Hun har arbejdet på adskillige prisvindende projekter for at fremhæve tilfælde af bias i computersyn og forbedre dokumentationspraksis inden for maskinlæring.