211service.com
Facebooks radioaktive data sporer de billeder, der bruges til at træne en AI
Kategori: Kunstig intelligens Udsendt 06 feb
Nyhederne: Et team fra Facebook AI Research har udviklet en måde at spore præcis hvilke billeder i et datasæt blev brugt til at træne en maskinlæringsmodel. Ved at lave umærkelige justeringer af billeder og skabe en slags vandmærke, var de i stand til at foretage små tilsvarende ændringer af den måde, en billedklassifikator trænede på disse billeder fungerer på, uden at forringe dets samlede nøjagtighed. Dette lod dem senere matche modeller med de billeder, der blev brugt til at træne dem.
Hvorfor det er vigtigt: Facebook kalder teknikken for radioaktiv data, fordi den er analog med brugen af radioaktive markører i medicin, som dukker op i kroppen under røntgen. Fremhævelse af, hvilke data der er blevet brugt til at træne en AI, gør modellerne mere gennemsigtige, og markerer potentielle kilder til bias – såsom en model trænet på et ikke-repræsentativt sæt billeder – eller afslører, hvornår et datasæt blev brugt uden tilladelse eller til upassende formål.
Tag ikke fejl: En stor udfordring var at ændre billederne uden at bryde den resulterende model. Små justeringer af en AI's input kan nogle gange føre til, at den laver dumme fejl, såsom at identificere en skildpadde som en pistol eller en dovendyr som en racerbil. Facebook sørgede for at designe sine vandmærker, så det ikke skete. Holdet testede sin teknik på ImageNet, et meget brugt datasæt med mere end 14 millioner billeder, og fandt ud af, at de kunne detektere brug af radioaktive data med høj tillid til en bestemt model, selv når kun 1% af billederne var blevet markeret.