Disse uhyggelige falske mennesker varsler en ny tidsalder inden for AI

syntetiske mennesker

Udlånt af Datagen





Du kan se de svage skægstubbe komme ind på hans overlæbe, rynkerne på hans pande, pletterne på hans hud. Han er ikke en rigtig person, men det er meningen, at han skal efterligne en - ligesom de hundredtusindvis af andre lavet af Datagen, et firma, der sælger falske, simulerede mennesker.

Disse mennesker er ikke spilleavatarer eller animerede figurer til film. De er syntetiske data designet til at fodre den voksende appetit af dyb-læring algoritmer. Firmaer som Datagen tilbyder et overbevisende alternativ til den dyre og tidskrævende proces med at indsamle data fra den virkelige verden. De vil lave det for dig: hvordan du vil have det, når du vil – og relativt billigt.

For at generere sine syntetiske mennesker, Datagen først scanner faktiske mennesker. Det samarbejder med leverandører, der betaler folk for at træde ind i gigantiske helkropsscannere, der fanger hver eneste detalje fra deres iris til deres hudtekstur til krumningen af ​​deres fingre. Opstarten tager derefter de rå data og pumper dem gennem en række algoritmer, som udvikler 3D-repræsentationer af en persons krop, ansigt, øjne og hænder.



Selskabet, som er baseret i Israel, siger, at det allerede arbejder med fire store amerikanske teknologigiganter, selvom det ikke vil afsløre, hvilke der er på rekorden. Dens nærmeste konkurrent, Syntese AI , tilbyder også on-demand digitale mennesker. Andre virksomheder genererer data, der skal bruges i finansiere , forsikring , og sundhedspleje . Der er cirka lige så mange syntetiske datavirksomheder da der er typer af data.

Engang blev syntetiske data set som mindre ønskværdige end reelle data, men nogle opfatter nu syntetiske data som et universalmiddel. Rigtige data er rodet og fyldt med bias. Nye regler om databeskyttelse gør det svært at indsamle. Derimod er syntetiske data uberørte og kan bruges til at bygge flere forskellige datasæt. Du kan producere perfekt mærkede ansigter, f.eks. af forskellige aldre, former og etniciteter for at bygge et ansigtsregistreringssystem, der fungerer på tværs af befolkninger.

Men syntetiske data har sine begrænsninger. Hvis det ikke afspejler virkeligheden, kan det ende med at producere endnu værre AI end rodet, forudindtaget data fra den virkelige verden - eller det kan simpelthen arve de samme problemer. Hvad jeg ikke vil gøre, er at give tommelfingeren op til dette paradigme og sige: 'Åh, det her vil løse så mange problemer,' siger Cathy O'Neil, en dataforsker og grundlægger af det algoritmiske revisionsfirma ORCAA. For det vil også ignorere en masse ting.



Realistisk, ikke ægte

Deep learning har altid handlet om data. Men i de sidste par år har AI-samfundet lært det godt data er vigtigere end stor data . Selv små mængder af de rigtige, rent mærkede data kan gøre mere for at forbedre et AI-systems ydeevne end 10 gange mængden af ​​ukurerede data eller endda en mere avanceret algoritme.

Det ændrer den måde, virksomheder bør gribe udviklingen af ​​deres AI-modeller an på, siger Datagens administrerende direktør og medstifter, Ofir Chakon. I dag starter de med at indhente så mange data som muligt og justerer og tuner derefter deres algoritmer for bedre ydeevne. I stedet burde de gøre det modsatte: Brug den samme algoritme, mens de forbedrer sammensætningen af ​​deres data.

Datagen genererer også falske møbler og indendørsmiljøer for at sætte sine falske mennesker i sammenhæng.



DATAGEN

Men at indsamle data fra den virkelige verden for at udføre denne form for iterative eksperimenter er for dyrt og tidskrævende. Det er her Datagen kommer ind i billedet. Med en syntetisk datagenerator kan teams skabe og teste snesevis af nye datasæt om dagen for at identificere, hvilket der maksimerer en models ydeevne.

For at sikre, at dataene er realistiske, giver Datagen sine leverandører detaljerede instruktioner om, hvor mange personer der skal scannes i hver aldersgruppe, BMI-interval og etnicitet, samt en liste over handlinger, som de skal udføre, som at gå rundt i et rum eller drikke en sodavand. Leverandørerne sender både statiske high-fidelity-billeder og motion-capture-data tilbage af disse handlinger. Datagens algoritmer udvider derefter disse data til hundredtusindvis af kombinationer. De syntetiserede data bliver nogle gange derefter kontrolleret igen. Falske ansigter plottes mod rigtige ansigter, for eksempel for at se, om de virker realistiske.

Datagen genererer nu ansigtsudtryk for at overvåge førerens opmærksomhed i smarte biler, kropsbevægelser for at spore kunder i kassefri butikker og iris- og håndbevægelser for at forbedre øje- og håndsporingsfunktionerne i VR-headset. Virksomheden siger, at deres data allerede er blevet brugt til at udvikle computer-vision-systemer, der betjener titusinder af brugere.



Det er ikke kun syntetiske mennesker, der bliver massefremstillet. Click-Ins er en startup, der bruger syntetisk kunstig intelligens til at udføre automatiske bilinspektioner. Ved hjælp af designsoftware genskaber den alle bilmærker og modeller, som dens AI skal genkende, og gengiver dem derefter med forskellige farver, skader og deformationer under forskellige lysforhold, mod forskellige baggrunde. Dette lader virksomheden opdatere sin AI, når bilproducenter udgiver nye modeller, og hjælper den med at undgå krænkelser af databeskyttelse i lande, hvor nummerplader betragtes som private oplysninger og derfor ikke kan være til stede på billeder, der bruges til at træne AI.

Click-Ins gengiver biler af forskellige mærker og modeller mod forskellige baggrunde.

KLIK-IND

Mest.ai samarbejder med finans-, telekommunikations- og forsikringsselskaber for at levere regneark med falske kundedata, der lader virksomheder dele deres kundedatabase med eksterne leverandører på en lovlig måde. Anonymisering kan reducere et datasæts rigdom, men alligevel ikke i tilstrækkelig grad at beskytte folks privatliv. Men syntetiske data kan bruges til at generere detaljerede falske datasæt, der deler de samme statistiske egenskaber som en virksomheds rigtige data. Det kan også bruges til at simulere data, som virksomheden endnu ikke har, herunder en mere forskelligartet kundepopulation eller scenarier som svigagtig aktivitet.

Tilhængere af syntetiske data siger, at det også kan hjælpe med at evaluere AI. I et nyligt papir offentliggjort på en AI-konference, Suchi Saria, en lektor i maskinlæring og sundhedspleje ved Johns Hopkins University, og hendes medforfattere demonstrerede, hvordan datagenereringsteknikker kunne bruges til at ekstrapolere forskellige patientpopulationer fra et enkelt sæt data. Dette kunne være nyttigt, hvis for eksempel en virksomhed kun havde data fra New York Citys mere ungdommelige befolkning, men ønskede at forstå, hvordan dens AI klarer sig på en aldrende befolkning med højere forekomst af diabetes. Hun starter nu sit eget firma, Bayesian Health, som vil bruge denne teknik til at hjælpe med at teste medicinske AI-systemer.

Grænserne for at forfalske det

Men er syntetiske data overhypet?

Når det kommer til privatlivets fred, betyder det ikke, at blot fordi dataene er 'syntetiske' og ikke direkte svarer til rigtige brugerdata, at de ikke koder for følsomme oplysninger om rigtige mennesker, siger Aaron Roth, professor i data- og informationsvidenskab ved University of Pennsylvania. Nogle datagenereringsteknikker har vist sig at gengive billeder eller tekst fundet i træningsdataene, for eksempel, mens andre er sårbare over for angreb, der får dem til at gengive disse data fuldstændigt.

Dette kan være fint for et firma som Datagen, hvis syntetiske data ikke er beregnet til at skjule identiteten på de personer, der har givet samtykke til at blive scannet. Men det ville være dårligt nyt for virksomheder, der tilbyder deres løsning som en måde at beskytte følsomme finansielle eller patientoplysninger på.

Året deepfakes blev mainstream I 2020 begyndte AI-syntetiske medier at bevæge sig væk fra de mørkere hjørner af internettet.

Forskning tyder på, at kombinationen af ​​to syntetiske data-teknikker i særdeleshed- differential privacy and generative kontradiktoriske netværk -kan producere den stærkeste privatlivsbeskyttelse, siger Bernease Herman, en dataforsker ved University of Washington eScience Institute. Men skeptikere bekymrer sig om, at denne nuance kan gå tabt i markedsføringssproget hos leverandører af syntetiske data, som ikke altid vil være fremme om, hvilke teknikker de bruger.

I mellemtiden tyder få beviser på, at syntetiske data effektivt kan afbøde skævheden i AI-systemer. For det første producerer ekstrapolering af nye data fra et eksisterende datasæt, der er skævt, ikke nødvendigvis data, der er mere repræsentative. Datagens rådata indeholder for eksempel forholdsmæssigt færre etniske minoriteter, hvilket betyder, at den bruger færre rigtige datapunkter til at generere falske mennesker fra disse grupper. Selvom generationsprocessen ikke er helt gætværk, kan disse falske mennesker stadig være mere tilbøjelige til at afvige fra virkeligheden. Hvis dine ansigter med mørkere hudtoner ikke er særligt gode tilnærmelser af ansigter, så løser du faktisk ikke problemet, siger O'Neil.

For en anden oversættes perfekt afbalancerede datasæt ikke automatisk til helt fair AI-systemer, siger Christo Wilson, lektor i datalogi ved Northeastern University. Hvis en kreditkortudlåner forsøgte at udvikle en AI-algoritme til at score potentielle låntagere, ville det ikke eliminere al mulig diskrimination ved blot at repræsentere hvide mennesker såvel som sorte mennesker i sine data. Diskrimination kan stadig snige sig ind gennem forskelle mellem hvide og sorte ansøgere.

For at komplicere sagerne yderligere viser tidlig forskning, at det i nogle tilfælde måske ikke engang er muligt at opnå begge dele privat og fair AI med syntetiske data. I et nyligt papir offentliggjort på en AI-konference, forsøgte forskere fra University of Toronto og Vector Institute at gøre det med røntgenbilleder af thorax. De fandt ud af, at de ikke var i stand til at skabe et nøjagtigt medicinsk AI-system, da de forsøgte at lave et mangfoldigt syntetisk datasæt gennem kombinationen af ​​differentieret privatliv og generative modstridende netværk.

Intet af dette betyder, at syntetiske data ikke bør bruges. Faktisk kan det godt blive en nødvendighed. Da regulatorer konfronterer behovet for at teste AI-systemer for lovlig overholdelse, kan det være den eneste tilgang, der giver dem den fleksibilitet, de har brug for til at generere on-demand, målrettede testdata, siger O'Neil. Men det gør spørgsmål om dets begrænsninger endnu vigtigere at studere og besvare nu.

Syntetiske data vil sandsynligvis blive bedre med tiden, siger hun, men ikke tilfældigt.

skjule