211service.com
OpenAI har udgivet den hidtil største version af sin falske nyhedsudspyende AI
Fotoillustration af JFK, der leverer falsk tale Ms. Tech; Wikimedia commons
I februar kastede OpenAI sig selv i offentligheden, da det producerede en sprogmodel, der var så god til at generere falske nyheder, at organisationen besluttede ikke at udgive den. Nogle inden for AI-forskningssamfundet hævdede, at det var en smart forholdsregel; andre afskrev det som et reklamestunt. Laboratoriet selv, en lille San Francisco-baseret for-profit, der søger at skabe kunstig generel intelligens, har fastholdt, at det er et vigtigt eksperiment i, hvordan man håndterer høj-satsede forskning.
Nu seks måneder senere har politikteamet offentliggjort en papir at undersøge konsekvenserne af beslutningen indtil videre. Ved siden af den har laboratoriet udgivet en version af modellen, kendt som GPT-2, der er halvt så stor som den fulde, som stadig ikke er blevet frigivet.
I maj, et par måneder efter GPT-2s første debut, reviderede OpenAI sin holdning til at tilbageholde den fulde kode til, hvad den kalder en trinvis udgivelse – den forskudte udgivelse af trinvist større versioner af modellen i en rampe-up til den fulde. I februar udgav den en version af modellen, der kun var 8% af størrelsen på den fulde. Den udgav yderligere omkring en fjerdedel af den fulde version før den seneste udgivelse. Under denne proces samarbejdede den også med udvalgte forskningsinstitutioner for at studere den fulde models implikationer.
Rapporten beskriver, hvad OpenAI har lært gennem hele denne proces. Den bemærker, at både de trinvise udgivelses- og forskningspartnerskabsaftaler viste sig at være processer, der er værd at replikere i fremtiden. De hjalp OpenAI med bedre at forstå og forudse den mulige ondsindede brug af GPT-2. Og faktisk var forskningspartnerne i stand til bedre at kvantificere nogle af de trusler, der kun tidligere var spekulative. Et studie udført af samarbejdspartnere ved Cornell University, for eksempel, fandt ud af, at læsere i gennemsnit troede, at GPT-2's output var ægte nyhedsartikler næsten lige så ofte som New York Times. Adskillige forskere uden for officielle partnerskaber begyndte også at tackle udfordringen med at opdage maskingenereret tekst.
GPT-2 i aktion
Menneskeskreven prompt:
John F. Kennedy er netop blevet valgt til USA's præsident efter at have rejst sig fra graven årtier efter hans mord. På grund af mirakuløse udviklinger inden for nanoteknologi blev Kennedys hjerne genopbygget fra hans rester og installeret i kontrolcentret af en avanceret humanoid robot. Nedenfor er en udskrift af hans takketale.
Fuld modelgenereret tekst:
Det er tid igen. Jeg tror på, at denne nation kan gøre store ting, hvis folket gør deres stemme hørt. Mændene og kvinderne i Amerika må endnu en gang tilkalde vores bedste elementer, al vores opfindsomhed, og finde en måde at vende en sådan overvældende tragedie til muligheden for et større gode og opfyldelsen af alle vores drømme. I de kommende måneder og år vil der være mange kampe, hvor vi bliver nødt til at være stærke, og vi skal give al vores energi, ikke for at afvise angribere, men snarere for at modstå aggression og vinde frihed og lighed for alle af vores folk. Menneskeslægtens skæbne hænger i en balance; vi har ikke råd til, at det smutter. Nu og i de kommende år er udfordringen foran os at finde ud af, hvordan vi opnår vores ultimative skæbne. Hvis vi undlader at gøre det, er vi dømt.
Forfatterne konkluderede, at OpenAI efter omhyggelig overvågning endnu ikke havde fundet nogen forsøg på ondsindet brug, men havde set adskillige gavnlige applikationer, herunder i kodeautofuldførelse, grammatikhjælp og udvikling af spørgsmål-besvarelsessystemer til medicinsk assistance. Som et resultat mente laboratoriet, at frigivelse af den seneste kode i sidste ende var mere fordelagtig. Andre forskere argumentere at adskillige vellykkede bestræbelser på at replikere GPT-2 alligevel har gjort OpenAI's tilbageholdelse af koden umulig.
Rapporten har fået blandet respons. Nogle har rost OpenAI for at sætte gang i en diskussion og introducere et nyt sæt normer, der ikke tidligere eksisterede. Den iscenesatte udgivelse af GPT-2 [...] var et nyttigt eksperiment, siger Peter Eckersley, forskningsdirektøren hos Partnership on AI, som OpenAI er medlem af. Ved at samle AI-fællesskabet for at debattere disse spørgsmål, har vi fundet ud af, at der er mange subtile stykker, der skal gøres rigtigt for at beslutte, hvornår og hvordan man publicerer forskning, der har en risiko for utilsigtede konsekvenser eller ondsindet brug.
Andre har dog været kritiske over for OpenAIs beslutninger. Vanya Cohen, en nylig kandidat fra Brown University, der genskabt en open source-version af GPT-2 , hævder, at tilbageholdelse af modellen gør mere for at bremse modforanstaltninger forskning end replikation. Store sprogmodeller som GPT-2 er de bedste tilgængelige værktøjer til at identificere falsk tekst genereret af de samme modeller, siger han.
Atter andre var mere målte: Jeg tror ikke, at en iscenesat udgivelse var særlig nyttig i dette tilfælde, fordi arbejdet er meget let at kopiere, siger Chip Huyen, en deep learning-ingeniør hos Nvidia. Men det kan være nyttigt på den måde, at det danner præcedens for fremtidige projekter. Folk vil se iscenesat udgivelse som en alternativ mulighed. Oren Etzioni, administrerende direktør for Allen Institute for Artificial Intelligence, som også har vedtaget en iscenesat udgivelse for sin sprogmodel Grover, gentager følelsen: Jeg bifalder deres hensigt om at designe en tankevækkende, gradvis udgivelsesproces for AI-teknologi, men stiller spørgsmålstegn ved, om al fanfaren var berettiget.
Jack Clark, den politiske direktør for OpenAI, placerer GPT-2 i sammenhæng med organisationens bredere mission. Hvis vi har succes som et AI-fællesskab med at være i stand til at opbygge [kunstig generel intelligens], vil vi have brug for en enorm mængde historiske eksempler inde fra AI på, hvordan vi håndterer forskning med høj indsats, siger han. Men hvad hvis der ikke er nogen historiske eksempler? Nå, så er du nødt til at generere [dine egne] beviser - hvilket er det, vi gør.