En AI til at generere falske nyheder kan også hjælpe med at opdage det

Hendrik Strobelt og Sebastian Gehrmann





Sidste måned tilbageholdt OpenAI ret dramatisk udgivelsen af ​​sin nyeste sprogmodel, GPT-2, fordi den frygtede, at den kunne blive brugt til at automatisere masseproduktionen af ​​misinformation. Beslutningen fremskyndede også AI-fællesskabets igangværende diskussion om, hvordan man opdager denne form for falske nyheder. I en ny eksperiment , overvejede forskere ved MIT-IBM Watson AI Lab og HarvardNLP, om de samme sprogmodeller, der kan skrive en så overbevisende prosa, også kan få øje på andre modelgenererede passager.

Ideen bag denne hypotese er enkel: sprogmodeller producerer sætninger ved at forudsige det næste ord i en sekvens af tekst. Så hvis de nemt kan forudsige de fleste af ordene i en given passage, er det sandsynligvis skrevet af en af ​​deres egne.

Forskerne testede deres idé ved at bygge en interaktivt værktøj baseret på den offentligt tilgængelige nedgraderede version af OpenAIs GPT-2. Når du tilfører værktøjet et tekststykke, fremhæver det ordene i grønt, gult eller rødt for at indikere, at det er mindre let at forudsige; den fremhæver dem i lilla, hvis den slet ikke ville have forudsagt dem. I teorien, jo højere brøkdelen af ​​røde og lilla ord, jo større er chancen for, at passagen er skrevet af et menneske; jo større andel af grønne og gule ord, jo mere sandsynligt er det skrevet af en sprogmodel.



opdager falske nyheder

En læseforståelsespassage fra en amerikansk standardiseret test, skrevet af et menneske. Hendrik Strobelt og Sebastian Gehrmann

opdager falske nyheder

En passage skrevet af OpenAI's nedgraderede GPT-2. Hendrik Strobelt og Sebastian Gehrmann

Forskerne fandt faktisk ud af, at passager skrevet af de nedgraderede og fulde versioner af GPT-2 kom ud næsten helt grønne og gule, mens videnskabelige abstracts skrevet af mennesker og tekst fra læseforståelsespassager i amerikanske standardiserede test havde masser af rødt og lilla.



Men ikke så hurtigt. Janelle Shane, en forsker, der driver den populære blog At lade neurale netværk være underlige og som ikke var involveret i den indledende forskning, satte værktøjet til en mere streng test . I stedet for blot at fodre den med tekst genereret af GPT-2, fodrede hun den også med passager skrevet af andre sprogmodeller, inklusive en trænet på Amazon-anmeldelser og en anden trænet i Dungeons and Dragons-biografier. Hun fandt ud af, at værktøjet ikke kunne forudsige en stor del af ordene i hver af disse passager, og derfor antog det, at de var menneskeskrevne. Dette identificerer en vigtig indsigt: en sprogmodel kan være god til at opdage sit eget output, men ikke nødvendigvis andres output.

Denne historie dukkede oprindeligt op i vores AI-nyhedsbrev The Algorithm. For at få det leveret direkte til din indbakke, tilmeld dig her gratis.

skjule