211service.com
Deltagere i Personal Genome Project Identificeret af Privacy Experts
Et af de største spørgsmål inden for biologi er natur versus nære debatten, de relative roller, som genetiske og miljømæssige faktorer spiller for at bestemme menneskelige egenskaber.
I 2006 startede George Church ved Harvard University og nogle få andre Personal Genome Project (PGP) for at hjælpe med at besvare dette spørgsmål. Målet er at indsamle genomisk information fra 100.000 informerede medlemmer af offentligheden sammen med deres helbredsjournaler og andre relevante fænotypiske data. Ideen er at bruge denne information til at hjælpe med at skille de relative bidrag fra genetiske og miljømæssige faktorer ad.
Projektet garanterer ikke privatlivets fred for dem, der tilmelder sig. Faktisk kan deltagerne afsløre så meget information, som de vil, herunder deres postnummer, fødselsdato og køn.
Dataene er dog 'afidentificeret' i den forstand, at ejernes navne og adresser ikke er inkluderet i deres profiler på PGP-webstedet, og dette genererer en finér af privatliv.
I dag viser Latanya Sweeney og kolleger på Harvard, at selv dette er praktisk talt nytteløst til at holde ejernes identiteter private. De siger, at en relativt simpel sammenligning af listen over PGP-deltagere med andre databaser, såsom vælgerlister, afslører identiteten af et betydeligt antal af dem med bemærkelsesværdig nøjagtighed.
De-anonymiseringsproceduren er enkel. Vælgerlister indeholder oplysninger, herunder navn, adresse, men også postnummer, fødselsdato og køn. Så det er ligetil at sammenligne denne liste med PGP-deltagere, som også har inkluderet deres postnummer, fødselsdato og køn.
Når der er et match, er spørgsmålet, om zip, fødselsdato og køn entydigt identificerer en person. Sweeney har tidligere hævdet, at det gør det med en nøjagtighed på op til 87 procent, afhængigt af faktorer som tætheden af mennesker, der bor i det pågældende postnummer.
Disse resultater ser ud til at bevise, at hun har ret. Sweeney og medindsendte resultaterne til PGP-organisationen og bad dem om at kontrollere, hvor nøjagtig afanonymiseringsprocessen havde været. Det viser sig, at de nøjagtigt identificerede personer med en succesrate på op til 97 procent.
Denne form for sårbarhed er velkendt. Vores evne til at lære deres navne at kende er baseret på deres demografi, ikke deres DNA, og derved gense en gammel sårbarhed, der let kunne forpurres med minimalt tab af forskningsværdi, siger Sweeney og venner.
De påpeger, at måden at løse dette problem på er at inkludere fødselsdatoer og postnumre, der er mindre præcise, f.eks. blot angiver et fødselsår eller det generelle bopælsområde.
Dette er ikke så nemt at ændre på PGP-webstedet, så holdet har skabt et frit tilgængeligt redigeringsværktøj, der giver enhver deltager mulighed for at ændre sine detaljer på webstedet på en måde, der reducerer chancen for identifikation.
(Sweeney og co påpeger også den indlysende taktik med at fjerne identificerende navne fra oplysninger knyttet til en deltagers profil, som de fandt i en betydelig del af indlæggene.)
Det burde gøre Personal Genome Project væsentligt mere privat for dem, der vælger denne mulighed. Det bør også tjene som en advarsel for fremtidige projekter, der involverer personlige data, om, at privatlivets fred ikke altid er så let at beskytte, som det umiddelbart ser ud til.
Ref: arxiv.org/abs/1304.7605 : Identifikation af deltagere i det personlige genomprojekt ved navn