211service.com
Kapløbet om at forstå sprogets AIs spændende, farlige verden
Ariel Davis
Den 18. maj annoncerede Googles administrerende direktør Sundar Pichai et imponerende nyt værktøj: et AI-system kaldet LaMDA, der kan chatte med brugere om ethvert emne.
Til at starte med planlægger Google at integrere LaMDA i sin primære søgeportal, sin stemmeassistent og Workplace, sin samling af cloud-baseret arbejdssoftware, der inkluderer Gmail, Docs og Drive. Men det endelige mål, sagde Pichai, er at skabe en samtalegrænseflade, der giver folk mulighed for at hente enhver form for information – tekst, visuel, lyd – på tværs af alle Googles produkter blot ved at spørge.
LaMDAs udrulning signalerer endnu en måde, hvorpå sprogteknologier bliver indviklet i vores daglige liv. Men Googles prangende præsentation afslog den etiske debat, der nu omgiver sådanne banebrydende systemer. LaMDA er det, der er kendt som en stor sprogmodel (LLM) - en dyb-læringsalgoritme trænet på enorme mængder tekstdata.
Undersøgelser har allerede vist, hvordan racistiske, sexistiske og krænkende ideer er indlejret i disse modeller. De forbinder kategorier som læger med mænd og sygeplejersker med kvinder; gode ord med hvide mennesker og dårlige med sorte mennesker. Undersøg dem med de rigtige anvisninger, og de begynder også at opmuntre til ting som folkedrab , selvskade , og seksuelt misbrug af børn . På grund af deres størrelse har de en chokerende højt CO2-fodaftryk . På grund af deres flydende, de let forvirre folk til at tro, at et menneske skrev deres output, hvilket eksperter advarer om kunne muliggøre masseproduktion af misinformation.
I december afsatte Google sin etiske AI-medleder Timnit Gebru efter det nægtede hun trække et papir tilbage det gjorde mange af disse pointer. Et par måneder senere, efter omfattende opsigelse af, hvad et åbent brev fra Google-medarbejdere kaldte virksomhedens hidtil usete forskningscensur, fyrede det også Gebrus medforfatter og medleder Margaret Mitchell.
Det er ikke kun Google, der implementerer denne teknologi. De højest profilerede sprogmodeller hidtil har været OpenAI's GPT-2 og GPT-3 , som udsender bemærkelsesværdigt overbevisende tekststykker og endda kan genbruges til at afslutte musikkompositioner og computerkode. Microsoft nu udelukkende licenser GPT-3 at inkorporere i endnu uanmeldte produkter. Facebook har udviklet sine egne LLM'er til oversættelse og indholdsmoderering. Og startups skaber snesevis af produkter og tjenester baseret på tech-giganternes modeller. Snart nok vil alle vores digitale interaktioner – når vi e-mailer, søger eller poster på sociale medier – blive filtreret gennem LLM'er.
Desværre bliver der lavet meget lidt forskning for at forstå, hvordan fejlene ved denne teknologi kan påvirke mennesker i applikationer i den virkelige verden, eller for at finde ud af, hvordan man designer bedre LLM'er, der afbøder disse udfordringer. Som Google understregede i sin behandling af Gebru og Mitchell, har de få virksomheder, der er rige nok til at uddanne og vedligeholde LLM'er, en stor økonomisk interesse i at afslå at undersøge dem omhyggeligt. Med andre ord bliver LLM'er i stigende grad integreret i den sproglige infrastruktur på internettet oven på vaklende videnskabelige grundlag.
Mere end 500 forskere rundt om i verden kører nu for at lære mere om disse modellers muligheder og begrænsninger. Arbejder sammen under BigScience-projektet ledet af Huggingface, en startup, der tager en åben videnskabelig tilgang til at forstå naturlig sprogbehandling (NLP), søger de at bygge en open source LLM, der vil tjene som en delt ressource for det videnskabelige samfund. Målet er at generere så meget stipendium som muligt inden for et enkelt fokuseret år. Deres centrale spørgsmål: Hvordan og hvornår skal LLM'er udvikles og implementeres for at høste deres fordele uden deres skadelige konsekvenser?
Vi kan ikke rigtig stoppe det her vanvid omkring store sprogmodeller, hvor alle gerne vil træne dem, siger Thomas Wolf, chief science officer hos Huggingface, som er med til at lede initiativet. Men hvad vi kan gøre, er at prøve at skubbe dette i en retning, der i sidste ende er mere gavnlig.
Stokastiske papegøjer
I samme måned, som BigScience startede sine aktiviteter, kom en startup ved navn Cohere stille og roligt ud af stealth. Startet af tidligere Google-forskere, lover det at bringe LLM'er til enhver virksomhed, der ønsker en - med en enkelt linje kode. Den har udviklet en teknik til at træne og hoste sin egen model med de ledige stykker af beregningsressourcer i et datacenter, hvilket holder omkostningerne ved at leje det nødvendige skyrum ud til vedligeholdelse og implementering.
Blandt dets tidlige kunder er opstarten Der er support , en platform til at bygge no-code kundesupport chatbots, som selv har kunder som Facebook og Zoom. Og Coheres investorliste omfatter nogle af de største navne på området: computervision-pioneren Fei-Fei Li, vinderen af Turing-prisen Geoffrey Hinton og Apples leder af AI, Ian Goodfellow.
Cohere er en af flere startups og initiativer, der nu søger at bringe LLM'er til forskellige industrier. Der er også Aleph Alpha, en startup baseret i Tyskland, der søger at bygge en tysk GPT-3 ; et unavngivet foretagende startet af flere tidligere OpenAI-forskere; og open source-initiativet Eleuther, som for nylig lancerede GPT-Neo , en gratis (og noget mindre kraftfuld) gengivelse af GPT-3.
Men det er kløften mellem, hvad LLM'er er, og hvad de ønsker at være, der har bekymret et stigende antal forskere. LLM'er er faktisk verdens mest kraftfulde autofuldførelsesteknologier. Ved at indtage millioner af sætninger, afsnit og endda eksempler på dialog lærer de de statistiske mønstre, der styrer, hvordan hvert af disse elementer skal samles i en fornuftig rækkefølge. Dette betyder, at LLM'er kan forbedre visse aktiviteter: for eksempel er de gode til at skabe mere interaktive og konversationsflydende chatbots der følger et veletableret manuskript . Men de forstår faktisk ikke, hvad de læser eller siger. Mange af de mest avancerede funktioner i LLM'er i dag er også kun tilgængelige på engelsk.
Relateret historie
Vi læste avisen, der tvang Timnit Gebru ud af Google. Her er hvad der står. Virksomhedens etiske stjerneforsker fremhævede risiciene ved store sprogmodeller, som er nøglen til Googles forretning.
Det er blandt andet, hvad Gebru, Mitchell og fem andre videnskabsmænd advarede om i deres papir, som kalder LLMs stokastiske papegøjer. Sprogteknologi kan være meget, meget nyttig, når den er passende omfang og placeret og indrammet, siger Emily Bender, professor i lingvistik ved University of Washington og en af medforfatterne til papiret. Men LLM'ers generelle karakter – og overbevisningsevnen i deres mimik – lokker virksomheder til at bruge dem på områder, de ikke nødvendigvis er udstyret til.
I en nylig keynote på en af de største AI-konferencer bandt Gebru denne forhastede implementering af LLM'er til konsekvenser, hun havde oplevet i sit eget liv. Gebru er født og opvokset i Etiopien, hvor en eskalerende krig har hærget den nordligste Tigray-region. Etiopien er også et land, hvor der tales 86 sprog, næsten alle, der ikke er redegjort for i almindelige sprogteknologier.
På trods af at LLM'er har disse sproglige mangler, er Facebook stærkt afhængig af dem for at automatisere sin indholdsmoderering globalt. Da krigen i Tigray første gang brød ud i november, så Gebru platformen skrubbe for at få styr på mylderet af misinformation. Dette er emblematisk for et vedvarende mønster, som forskere har observeret i indholdsmoderering. Fællesskaber, der tale sprog ikke prioriteret af Silicon Valley lider under de mest fjendtlige digitale miljøer.
Gebru bemærkede, at det heller ikke er her skaden ender. Når falske nyheder, hadefulde ytringer og endda dødstrusler ikke modereres, bliver de derefter skrabet som træningsdata for at bygge den næste generation af LLM'er. Og disse modeller, der papegøjer tilbage, hvad de er trænet i, ender med at genoplive disse giftige sproglige mønstre på internettet.
I mange tilfælde har forskere ikke undersøgt grundigt nok til at vide, hvordan denne toksicitet kan manifestere sig i downstream-applikationer. Men der findes et eller andet stipendium. I hendes bog fra 2018 Algoritmer for undertrykkelse , Safiya Noble, en lektor i information og afroamerikanske studier ved University of California, Los Angeles, dokumenterede, hvordan skævheder indlejret i Google-søgning fastholder racisme og i ekstreme tilfælde måske endda motiverer racevold.
Konsekvenserne er ret alvorlige og betydelige, siger hun. Google er ikke kun den primære vidensportal for almindelige borgere. Det leverer også informationsinfrastrukturen til institutioner, universiteter og statslige og føderale regeringer.
Google bruger allerede en LLM til at optimere nogle af sine søgeresultater. Med sin seneste meddelelse om LaMDA og et nyligt forslag det udgivet i et fortrykt papir, har virksomheden gjort det klart, at det kun vil øge sin afhængighed af teknologien. Ædle bekymringer, at dette kunne gøre de problemer, hun afslørede, endnu værre: Det faktum, at Googles etiske AI-team blev fyret for at rejse meget vigtige spørgsmål om de racistiske og sexistiske diskriminationsmønstre, der er indlejret i store sprogmodeller, burde have været et wake-up call.
BigScience
BigScience-projektet startede som direkte reaktion på det voksende behov for videnskabelig undersøgelse af LLM'er. Da han observerede teknologiens hurtige spredning og Googles forsøg på censur af Gebru og Mitchell, indså Wolf og flere kolleger, at det var på tide for forskersamfundet at tage sagen i egen hånd.
Inspireret af åbne videnskabelige samarbejder som CERN inden for partikelfysik udtænkte de en idé til en open source LLM, der kunne bruges til at udføre kritisk forskning uafhængig af enhver virksomhed. I april i år modtog gruppen et tilskud til at bygge det ved hjælp af den franske regerings supercomputer.
Hos tech-virksomheder bygges LLM'er ofte af kun et halvt dusin mennesker, der primært har teknisk ekspertise. BigScience ønskede at hente hundredvis af forskere fra en bred vifte af lande og discipliner til at deltage i en ægte samarbejdsmodel-konstruktionsproces. Wolf, som er fransk, henvendte sig først til det franske NLP-samfund. Derfra sneede initiativet sig til en global operation, der omfattede mere end 500 mennesker.
Samarbejdet er nu løst organiseret i et dusin arbejdsgrupper og tæller, der hver især tackler forskellige aspekter af modeludvikling og undersøgelse. En gruppe vil måle modellens miljøpåvirkning, herunder CO2-fodaftrykket ved træning og drift af LLM og medregne supercomputerens livscyklusomkostninger. En anden vil fokusere på at udvikle ansvarlige måder at hente træningsdata på – at søge alternativer til blot at skrabe data fra nettet, såsom transskribering af historiske radioarkiver eller podcasts. Målet her er at undgå giftigt sprogbrug og indsamling af private oplysninger uden samtykke.
Relateret historie
Hvorfor GPT-3 er den bedste og værste AI lige nu Open AI's sprog AI imponerede offentligheden med dets tilsyneladende beherskelse af engelsk – men er det hele en illusion?
Andre arbejdsgrupper er dedikeret til at udvikle og evaluere modellens flersprogethed. Til at starte med har BigScience udvalgt otte sprog eller sprogfamilier, inklusive engelsk, kinesisk, arabisk, indisk (inklusive hindi og urdu) og bantu (inklusive swahili). Planen er at arbejde tæt sammen med alle sprogsamfund for at kortlægge så mange af dets regionale dialekter som muligt og sikre, at dets særskilte databeskyttelsesnormer respekteres. Vi ønsker, at folk skal have indflydelse på, hvordan deres data bliver brugt, siger Yacine Jernite, en Huggingface-forsker.
Pointen er ikke at bygge en kommercielt levedygtig LLM til at konkurrere med GPT-3 eller LaMDA. Modellen bliver for stor og for langsom til at være nyttig for virksomheder, siger Karën Fort, der er lektor ved Sorbonne. I stedet designes ressourcen udelukkende til forskning. Hvert datapunkt og hver modelbeslutning bliver omhyggeligt og offentligt dokumenteret, så det er nemmere at analysere, hvordan alle dele påvirker modellens resultater. Det handler ikke kun om at levere det endelige produkt, siger Angela Fan, en Facebook-forsker. Vi forestiller os hvert enkelt stykke af det som et leveringssted, som en artefakt.
Projektet er uden tvivl ambitiøst - mere globalt ekspansivt og samarbejdende end noget AI-fællesskabet har set før. Logistikken ved at koordinere så mange forskere er i sig selv en udfordring. (Faktisk er der også en arbejdsgruppe til det.) Desuden bidrager hver enkelt forsker på frivillig basis. Tilskuddet fra den franske regering dækker kun beregningsmæssige, ikke menneskelige ressourcer.
Men forskere siger, at det fælles behov, der bragte samfundet sammen, har galvaniseret et imponerende niveau af energi og fremdrift. Mange er optimistiske over, at de ved afslutningen af projektet, som løber indtil maj næste år, ikke kun vil have produceret dybere stipendier om begrænsningerne ved LLM'er, men også bedre værktøjer og praksis til at bygge og implementere dem ansvarligt.
Arrangørerne håber, at dette vil inspirere flere mennesker i industrien til at inkorporere denne praksis i deres egen LLM-strategi, selvom de er de første til at indrømme, at de er idealistiske. Om noget, vil det store antal involverede forskere, herunder mange fra teknologigiganter, hjælpe med at etablere nye normer inden for NLP-samfundet.
På nogle måder har normerne allerede ændret sig. Som svar på samtaler omkring fyringen af Gebru og Mitchell hørte Cohere fra flere af sine kunder, at de var bekymrede for teknologiens sikkerhed. På sin hjemmeside indeholder den en side på sin hjemmeside med et løfte om løbende at investere i teknisk og ikke-teknisk forskning for at afbøde de mulige skader ved sin model. Det siger, at det også vil samle et rådgivende råd bestående af eksterne eksperter for at hjælpe det med at skabe politikker for den tilladte brug af dets teknologier.
NLP er ved et meget vigtigt vendepunkt, siger Fort. Derfor er BigScience spændende. Det giver fællesskabet mulighed for at skubbe forskningen fremad og give et håbefuldt alternativ til status quo inden for industrien: Den siger: 'Lad os tage endnu et pas. Lad os tage det sammen - for at finde ud af alle måder og alle de ting, vi kan gøre for at hjælpe samfundet.'
Jeg vil have NLP til at hjælpe folk, siger hun, til ikke at lægge dem ned.
Opdatering: Coheres ansvarsinitiativer er afklaret.