Machine-Vision Algorithm lærer at transformere håndtegnede skitser til fotorealistiske billeder

At tegne en nøjagtig skitse af en persons ansigt er en kunst, som er svær for de fleste at mestre. Men det viser sig at være relativt nemt for computere. Der findes forskellige programmer til at konvertere billeder til stregtegninger. Det giver ofte en anstændig start, selvom disse systemer kan have svært ved skygger og høj kontrast.





En mere lovende tilgang er at bruge maskinsynsalgoritmer, der er afhængige af neurale netværk til at udtrække funktioner fra et billede og bruge disse til at producere en skitse. På dette område er maskiner begyndt at konkurrere med og endda overgå mennesker med at producere nøjagtige skitser.

Men hvad med det omvendte problem? Dette starter med en skitse og har til formål at producere et nøjagtigt farvefoto af det originale ansigt. Det er klart en meget sværere opgave, så meget, at mennesker sjældent selv prøver.

Nu har maskinerne knækket dette problem. I dag har Yagmur Gucluturk, Umut Guclu og venner ved Radboud Universitet i Holland undervist et neuralt netværk i at omdanne håndtegnede skitser af ansigter til fotorealistiske portrætter. Arbejdet er endnu en demonstration af den måde, intelligente maskiner, og neurale netværk i særdeleshed, begynder at udkonkurrere mennesker i en stadigt bredere række af opgaver.



Radboud-teamet begynder med et datasæt på 200.000 billeder af ansigter taget fra internettet. De konverterede disse til stregtegninger, gråtoneskitser og farveskitser ved hjælp af standard billedbehandlingsalgoritmer. Dette skabte et betydeligt træningsdatasæt til at lære et dybt foldet neuralt netværk med 11 lag at udføre opgaven omvendt: Gør en skitse til et fotorealistisk farvefotografi af et ansigt.

Efter at have trænet nettet, satte holdet det igennem ved hjælp af et andet datasæt. Opgaven for det neurale net var at starte med skitsen og producere et fotorealistisk billede.

Resultaterne er imponerende, især da det neurale netværk startede med stregtegninger. Vi fandt ud af, at linjemodellen klarede sig imponerende med hensyn til at matche individernes hår- og hudfarve, selv når linjeskitserne ikke indeholdt nogen farveinformation, siger teamet.



Årsagen synes klar. Dette kan tyde på, at modellen sammen med at udnytte luminansforskellene i skitserne til at udlede farvning, var i stand til at lære farveegenskaber, der ofte er forbundet med ansigtstræk på højt niveau af forskellige etniciteter, foreslår de.

Derefter testede holdet det neurale net på et helt andet datasæt ved hjælp af håndtegnede skitser, som åbenbart er genereret på en helt anden måde end dem, nettet blev trænet på. Endnu en gang syntetiserede modellen fotorealistiske ansigtsbilleder, siger de.

Nettet var selvfølgelig ikke perfekt. Især havde den problemer, når blyantstrøg i håndtegnede skitser ikke blev ledsaget af skygge. Dette førte til mindre realistiske resultater. Dette kan forklares med manglen på sådanne funktioner i træningsdataene for linjeskitsemodellen, siger de og tilføjer, at denne mangel let kan overvindes ved at inkludere eksempler i træningssættet, der mere ligner skitsekunstnernes tegnestil, siger Radboud-forskerne.



Endelig tillod holdet deres neurale net at vise båd ved at producere fotorealistiske billeder af kunstnere som Rembrandt og Van Gogh fra skitserede selvportrætter, som begge kunstnere havde lavet.

Det er imponerende arbejde, der viser, hvordan dybe neurale netværk hurtigt begynder at udkonkurrere mennesker i synsopgaver. Den åbenlyse umiddelbare anvendelse er i retsmedicin, hvor nøjagtige billeder af mistænkte skal konstrueres af politikunstnere.

Og dette er blot én måde af mange måder, hvorpå disse maskiner viser deres overlegenhed. Machine-vision-algoritmer kan også udføre opgaver som at kopiere og indsætte kunstnerisk stil fra et billede til et andet, tilføje farver til gråtonebilleder nøjagtigt og omdanne billeder i lav opløsning til billeder i høj opløsning.



Alt dette er sket på blot et par års udvikling, og dybe neurale netværk har meget længere at gå. Det er svært at forudsige, hvad de vil være i stand til om for eksempel bare et års tid.

Ref: arxiv.org/abs/1606.03073 : Convolutional Sketch Inversion

skjule