211service.com
Dette er, hvordan AI-bias virkelig sker - og hvorfor det er så svært at rette
Ms. Tech; Foto: PIXOLOGICSTUDIO/SCIENCE PHOTO LIBRARY
I løbet af de sidste par måneder har vi dokumenteret, hvordan langt størstedelen af AI’s applikationer i dag er baseret på kategorien af algoritmer kendt som deep learning, og hvordan deep-learning algoritmer finder mønstre i data. Vi har også dækket, hvordan disse teknologier påvirker folks liv: hvordan de kan fastholde uretfærdighed i ansættelser, detailhandel og sikkerhed og måske allerede gør det i det strafferetlige system.
Men det er ikke nok bare at vide, at denne skævhed eksisterer. Hvis vi vil være i stand til at reparere det, er vi nødt til at forstå mekanikken i, hvordan det opstår i første omgang.
Hvordan AI-bias opstår
Vi kortlægger ofte vores forklaring på AI-bias ved at skyde skylden på forudindtaget træningsdata. Virkeligheden er mere nuanceret: Bias kan snige sig ind længe før dataene afhentes samt kl mange andre stadier af den dybe læringsproces. Med henblik på denne diskussion vil vi fokusere på tre nøglefaser.
Indramning af problemet. Det første dataloger gør, når de opretter en dyb-læringsmodel, er at beslutte, hvad de faktisk vil have den til at opnå. Et kreditkortselskab vil for eksempel måske gerne forudsige en kundes kreditværdighed, men kreditværdighed er et ret tåget begreb. For at omsætte det til noget, der kan beregnes, skal virksomheden beslutte, om den f.eks. vil maksimere sine fortjenstmargener eller maksimere antallet af lån, der bliver tilbagebetalt. Det kunne derefter definere kreditværdighed inden for rammerne af dette mål. Problemet er, at disse beslutninger træffes af forskellige forretningsmæssige årsager, bortset fra retfærdighed eller diskrimination, forklarer Solon Barocas, en assisterende professor ved Cornell University, som har specialiseret sig i retfærdighed i maskinlæring. Hvis algoritmen opdagede, at det at give subprime-lån var en effektiv måde at maksimere profitten på, ville den ende med at engagere sig i underlig adfærd, selvom det ikke var virksomhedens intention.
Indsamling af data. Der er to hovedmåder, som bias viser sig i træningsdata: enten er de data, du indsamler, ikke repræsentative for virkeligheden, eller også afspejler de eksisterende fordomme. Det første tilfælde kan for eksempel forekomme, hvis en dyb-læringsalgoritme fodres med flere billeder af lyshudede ansigter end mørkhudede ansigter. Det resulterende ansigtsgenkendelsessystem ville uundgåeligt være dårligere til at genkende mørkere ansigter. Det andet tilfælde er præcis, hvad der skete, da Amazon opdagede, at dets interne rekrutteringsværktøj var afskedigelse af kvindelige kandidater . Fordi den blev trænet i historiske ansættelsesbeslutninger, som favoriserede mænd frem for kvinder, lærte den at gøre det samme.
Forberedelse af data. Endelig er det muligt at indføre bias i dataforberedelsesstadiet, hvilket involverer at vælge, hvilke attributter du ønsker, at algoritmen skal overveje. (Dette skal ikke forveksles med problem-framing-stadiet. Du kan bruge de samme attributter til at træne en model til meget forskellige mål eller bruge meget forskellige attributter til at træne en model til det samme mål.) I tilfælde af modellering af kreditværdighed, en egenskab kan være kundens alder, indkomst eller antal afbetalte lån. I tilfælde af Amazons rekrutteringsværktøj kan en egenskab være kandidatens køn, uddannelsesniveau eller års erfaring. Dette er, hvad folk ofte kalder kunsten at deep learning: At vælge hvilke egenskaber, der skal tages i betragtning eller ignoreres, kan have stor indflydelse på din models forudsigelsesnøjagtighed. Men selvom dens indvirkning på nøjagtigheden er let at måle, er dens indvirkning på modellens bias ikke.
Hvorfor AI-bias er svært at rette op på
I betragtning af den kontekst kan nogle af udfordringerne med at afbøde skævhed allerede være tydelige for dig. Her fremhæver vi fire vigtigste.
Ukendte ukendte. Indførelsen af bias er ikke altid indlysende under en models konstruktion, fordi du måske ikke indser nedstrømsvirkningerne af dine data og valg før meget senere. Når du først har gjort det, er det svært med tilbagevirkende kraft at identificere, hvor den skævhed kom fra og derefter finde ud af, hvordan man kan slippe af med den. I Amazons tilfælde, da ingeniørerne oprindeligt opdagede, at dets værktøj straffede kvindelige kandidater, omprogrammerede de det til at ignorere eksplicit kønsbestemte ord som kvinders. De opdagede hurtigt, at det reviderede system stadig var ved at tage fart implicit kønnede ord - verber, der var stærkt korreleret med mænd frem for kvinder, såsom henrettet og fanget - og bruge det til at træffe sine beslutninger.
Ufuldkomne processer. For det første er mange af standardpraksis inden for deep learning ikke designet med bias-detektion i tankerne. Deep-learning-modeller testes for ydeevne, før de implementeres, hvilket skaber, hvad der synes at være en perfekt mulighed for at fange bias. Men i praksis ser test normalt sådan ud: dataloger opdeler tilfældigt deres data Før træning i én gruppe, der faktisk bruges til træning, og en anden, der er reserveret til validering, når træningen er færdig. Det betyder, at de data, du bruger til at teste din models ydeevne, har de samme skævheder som de data, du brugte til at træne den. Således vil den ikke markere skæve eller fordomsfulde resultater.
Mangel på social sammenhæng. Tilsvarende er den måde, hvorpå dataloger læres at indramme problemer, ofte ikke forenelig med den bedste måde at tænke på sociale problemer. For eksempel i et nyt papir , Andrew Selbst, en postdoc ved Data & Society Research Institute, identificerer, hvad han kalder portabilitetsfælden. Inden for datalogi anses det for god praksis at designe et system, der kan bruges til forskellige opgaver i forskellige sammenhænge. Men det, der gør, er at ignorere en masse social sammenhæng, siger Selbst. Du kan ikke have et system designet i Utah og derefter anvendt i Kentucky direkte, fordi forskellige samfund har forskellige versioner af retfærdighed. Eller du kan ikke have et system, hvor du ansøger om 'rimelige' strafferetlige resultater og derefter anvendes til ansættelse. Hvordan vi tænker om retfærdighed i de sammenhænge er bare helt anderledes.
Definitioner af retfærdighed. Det er heller ikke klart, hvordan fraværet af bias skal se ud. Dette er ikke kun sandt inden for datalogi - dette spørgsmål har en lang historie med debat inden for filosofi, samfundsvidenskab og jura. Hvad der er anderledes ved datalogi er, at begrebet retfærdighed skal defineres i matematiske termer, som at balancere de falske positive og falske negative satser i et forudsigelsessystem. Men som forskere har opdaget, er der mange forskellige matematiske definitioner af retfærdighed, som også udelukker hinanden. Betyder retfærdighed f.eks., at samme andel af sorte og hvide personer bør opnå høje risikovurderingsscore? Eller at samme risikoniveau skal resultere i samme score uanset race? Det er umuligt at opfylde begge definitioner på samme tid ( her er et mere dybdegående kig på hvorfor), så på et tidspunkt skal du vælge en. Men hvor denne beslutning på andre områder forstås som noget, der kan ændre sig over tid, har datalogi-området en forestilling om, at det bør rettes. Ved at rette svaret løser du et problem, der ser meget anderledes ud, end hvordan samfundet har en tendens til at tænke på disse problemer, siger Selbst.
Hvor vi går herfra
Hvis du trækker dig tilbage fra vores hvirvelvindsrundvisning om det fulde omfang af AI-bias-problemet, er jeg det også. Men heldigvis arbejder et stærkt kontingent af AI-forskere hårdt på at løse problemet. De har taget en række forskellige tilgange: Algoritmer, der hjælper opdage og afbøde skjulte skævheder i træningsdata eller som afbøder skævheder lært af modellen uanset datakvaliteten; processer der holder selskaber ansvarlig til de mere retfærdige resultater og diskussioner der hash ud af de forskellige definitioner af retfærdighed.
At ’fikse’ diskrimination i algoritmiske systemer er ikke noget, der let kan løses, siger Selbst. Det er en løbende proces, ligesom diskrimination i ethvert andet aspekt af samfundet.
Dette dukkede oprindeligt op i vores AI-nyhedsbrev The Algorithm. For at få det leveret direkte til din indbakke, tilmeld dig her gratis.