211service.com
Et nyt sæt billeder, der narrer AI, kan hjælpe med at gøre det mere hackersikkert
fotografi, der viser en svamp, guldsmede og egern, alle fejlmærket som kringle, kloakdæksel og søløve Unsplash: Florian Van Duyn / Krzysztof Niewolny / Pranay Pareek
Kunstig intelligens er fantastisk til at identificere objekter i billeder, men det er stadig ret nemt at ødelægge det. Tilføj et par udvalgte streger eller lag i noget statisk støj, der er usynligt for det menneskelige øje, og du kan smide et billedgenkendelsessystem af sig, nogle gange med dødelig virkning. Tilføjelse af klistermærker til et stopskilt kan få en selvkørende bil til at tro, at skiltet har en hastighedsgrænse på 45 mil i timen, for eksempel, mens tilføjelse af dem til en vej kan få en Tesla til at svinge ind i den modkørende vognbane. (På den lyse side kan de samme teknikker også beskytte dig mod overvågningstilstanden. Du vinder noget, du taber noget.)
Alle disse er kendt som modstridende eksempler - og forskere forsøger nu at udvikle måder at beskytte AI-systemer mod dem. Men i en papir sidste år argumenterede en gruppe forskere ved Google Brain og Princeton, herunder en af de tidligste forskere om dette emne, Ian Goodfellow, at det nye stipendium var for teoretisk og gik glip af pointen.
Mens hovedparten af forskningen fokuserede på at beskytte systemer mod specialdesignede forstyrrelser, ville en hacker, sagde de, sandsynligvis vælge et mere sløvt værktøj: et helt andet foto frem for et støjmønster at lægge på et eksisterende. Dette kan også få systemet til at opføre sig forkert.
Kritikken fik Dan Hendrycks, en ph.d.-studerende ved University of California, Berkeley, til at udarbejde en nyt billeddatasæt . Han kalder billederne, den indeholder naturlige modstridende eksempler - uden nogen særlige justeringer, narrer de et system alligevel.
De inkluderer ting som et egern, som almindelige systemer fejlmærker som en søløve, eller en guldsmede, som de fejlidentificerer som et kloakdæksel. Disse eksempler fremstår meget sværere at forsvare sig imod, siger han. Syntetiske modstridende eksempler skal kende alle AI-systemets forsvar for at være mest effektive. I modsætning hertil kan naturlige eksempler fungere ret godt, selv når disse forsvar ændrer sig, siger han.
Hendrycks udgav en tidlig version af datasættet med omkring 6.000 billeder i sidste uge ved den internationale konference om maskinlæring. Han planlægger at udgive en endelig version med tæt på 8.000 om et par uger. Han har til hensigt, at forskningsmiljøet skal bruge datasættet som benchmark.
Med andre ord, i stedet for at træne billedgenkendelsessystemer direkte på billederne, bør de kun reservere dem til test. Hvis folk bare skulle træne på dette datasæt, er det bare at huske disse eksempler, siger han. Det ville være at løse datasættet, men ikke opgaven med at være robust over for nye eksempler.
At knække logikken bag de til tider forvirrende fejl, som eksemplerne forårsager, kan føre til mere modstandsdygtige systemer. Hvordan forvirrer dette en guldsmede med guacamole? Hendrycks joker. Det er ikke så klart, hvorfor fejlen overhovedet begås.