Machine vision kan skabe billeder i Harry Potter-stil til mugglere

Chung-Yi Weng | youtube





I J.K. Rowlings Harry Potter-romaner, magiske fotografier ligner almindelige bortset fra, at karaktererne i dem er animerede; de vinker, smiler eller forsvinder nogle gange helt for at tage sig af andre forretninger.

Magiske billeder er skabelsen af ​​Rowlings ekstraordinære fantasi. Men noget som dem kan snart være tilgængeligt for almindelige mugglere takket være arbejdet fra Chung-Yi Weng ved University of Washington i Seattle og et par venner. Disse folk har lavet et stykke software kaldet Photo Wake-Up, der kan animere den centrale karakter i et fotografi, mens resten af ​​billedet ikke er rørt.

Denne opgave er lettere sagt end gjort på grund af et vigtigt uløst problem inden for datalogi. Dette er problemet med kropsstillingsvurdering. Givet et todimensionelt billede af et menneske, er spørgsmålet, som maskinsyn kæmper med at besvare: hvilken tredimensionel positur indtager personen?



Det er svært, fordi kroppe kan være delvist okkluderede, ofte af andre kropsdele, som når nogen står med armene kors. Det gør det svært for en maskine at bestemme den tredimensionelle struktur ud fra et 2D-billede.

En bred vifte af datalogiske hold har forsøgt at tackle dette problem. I dette arbejde bruger Weng og co et program kaldet SMPL, udviklet af et team hos Microsoft og Max Planck Institute for Intelligent Systems i Tyskland.

Dette begynder med en 2D-udskæring af en menneskekrop og overlejrer et 3D-skelet på formen. Skelettet kan derefter animeres for at skabe følelsen af ​​bevægelse. Det løser problemet med estimering af positur, omend for et begrænset sæt omstændigheder.



Koden skal se en hoved-til-tå-udskæring af en krop synes forfra. Den kan håndtere nogle typer okklusion, såsom en arm foran kroppen, men kan ikke håndtere mere komplekse okklusioner, såsom en person, der sidder med benene over kors. Selv stadig giver kortlægning af udskæringen fra et fotografi til et 3D-skelet ikke realistiske animationer.

Det er her, Weng og co kommer ind i billedet. Deres vigtigste præstation er at udvikle en måde at fordreje 2D-udskæringen på på en måde, der skaber en realistisk 3D-model af kroppen. Vores vigtigste tekniske bidrag er altså en metode til at konstruere en animerbar 3D-model, der matcher silhuetten på et enkelt billede, siger de.

Tidligere har dataloger forsøgt at løse dette problem ved at deformere et tredimensionelt kropsformet net for at afspejle 2D-udskæringen. Det fungerer ikke altid godt, så Weng og co prøver en anden tilgang.



Deres idé er at kortlægge det kropsformede mesh i 2D-rum og derefter justere det med 2D-udskæringen ved hjælp af en vridningsalgoritme. Dette identificerer specifikke dele af kroppen - hoved, højre arm, højre ben, venstre arm, venstre ben og torso - og deformerer hver enkelt på en måde, der matcher udskæringen.

Efter at have udført justeringen i 2D, transformerer de den tilbage til 3D. Denne 2D-vridningstilgang fungerer godt til at håndtere komplekse silhuetter, siger de.

Holdet er særligt opmærksomme på hovedet, som menneskelige seere har en tendens til at fokusere på. Nøjagtighed i hovedstillingen er vigtig for god animation, siger de. Så deres algoritme identificerer også funktioner såsom blikretning og hovedvinkel, og brug derefter denne til at få en præcis vinkel for kropsmasket hovedposition.



Disse automatiserede teknikker er gode, men de er ikke perfekte. Så holdet har også udviklet en brugergrænseflade, der giver enhver mulighed for at ændre skelettets orientering i forhold til kroppen. Det giver brugerne mulighed for at rette eventuelle fejl og finjustere animationen.

Slutresultatet er en imponerende form for animeret foto. Algoritmen isolerer en menneskelig krop i fotografiet, skærer den ud af billedet og udfylder hullet med en patch-filling-algoritme. Den animerer derefter denne krop i tre dimensioner for at få den til at gå ud af billedet, til at løbe, hoppe eller vinke, ligesom de magiske billeder, som Rowling forestiller sig. Algoritmen fungerer endda i augmented-reality-indstillinger.

Vores metode fungerer med et stort udvalg af ret frontale billeder af hele kroppen, lige fra sportsbilleder til kunst og plakater, siger de. Holdet har lavet en video, der viser deres metode og resultater her . Det er værd at se!

Det er interessant arbejde med potentiale til at underholde og informere. Som Weng og co udtrykte det: Vi mener, at metoden ikke kun muliggør nye måder for folk at nyde og interagere med fotos, men foreslår også en vej til at rekonstruere en virtuel avatar ud fra et enkelt billede, samtidig med at den giver indsigt i menneskets state of the art. modellering fra et enkelt billede.

Selv Rowling ville helt sikkert blive imponeret.

Ref: arxiv.org/abs/1812.02246 : Foto Wake-Up: 3D Character Animation fra et enkelt billede

skjule