Machine vision har lært at bruge radiobølger til at se gennem vægge og i mørke

Handlingsgenkendelsesudgang, der viser figurer, der sparker og klapper på ryggen

Handlingsgenkendelsesudgang, der viser figurer, der sparker og klapper på ryggen MED CSAIL





Maskinsyn har en imponerende rekord. Det har den overmenneskelige evne til at genkende mennesker, ansigter og objekter. Den kan endda genkende mange forskellige slags handlinger, omend ikke helt så godt som mennesker lige foreløbig.

Men der er grænser for dens ydeevne. Maskiner har en særlig vanskelig tid, når mennesker, ansigter eller genstande er delvist tillukket. Og når lysniveauet falder for langt, bliver de effektivt blændet, ligesom mennesker.

Men der er en anden del af det elektromagnetiske spektrum, som ikke er begrænset på samme måde. Radiobølger fylder vores verden, uanset om det er nat eller dag. De passerer let gennem vægge og både transmitteres og reflekteres af menneskekroppe. Faktisk har forskere udviklet forskellige måder at bruge Wi-Fi-radiosignaler til at se bag lukkede døre.



Men disse radiovisionsystemer har nogle mangler. Deres opløsning er lav; billederne er støjende og fyldt med distraherende refleksioner, som gør det svært at forstå, hvad der foregår.

I denne forstand har radiobilleder og billeder med synligt lys komplementære fordele og ulemper. Og det øger muligheden for at bruge den enes styrker til at overvinde den andens mangler.

Indtast Tianhong Li og kolleger på MIT, som har fundet en måde at lære et radiovisionssystem at genkende folks handlinger ved at træne det med billeder i synligt lys. Det nye radiovisionssystem kan se, hvad individer har gang i i en lang række situationer, hvor billeddannelsen af ​​synligt lys svigter. Vi introducerer en neural netværksmodel, der kan detektere menneskelige handlinger gennem vægge og okklusioner og under dårlige lysforhold, siger Li og co.



Holdets metode bruger et pænt trick. Den grundlæggende idé er at optage videobilleder af den samme scene ved hjælp af synligt lys og radiobølger. Machine-vision-systemer er allerede i stand til at genkende menneskelige handlinger fra billeder med synligt lys. Så det næste skridt er at korrelere disse billeder med radiobillederne af den samme scene.

Men vanskeligheden ligger i at sikre, at læringsprocessen fokuserer på menneskelig bevægelse frem for andre funktioner, såsom baggrunden. Så Li og co introducerer et mellemtrin, hvor maskinen genererer 3D-stick-figur-modeller, der gengiver handlingerne fra personerne i scenen.

Radiosyn

Ved at oversætte inputtet til en mellemliggende skeletbaseret repræsentation kan vores model lære af både visionsbaserede og radiofrekvensbaserede datasæt og lade de to opgaver hjælpe hinanden. siger Li og co.



På denne måde lærer systemet at genkende handlinger i synligt lys og derefter at genkende de samme handlinger, der finder sted i mørke eller bag vægge, ved hjælp af radiobølger. Vi viser, at vores model opnår sammenlignelig nøjagtighed med visionsbaserede handlingsgenkendelsessystemer i synlige scenarier, men alligevel fortsætter med at arbejde præcist, når folk ikke er synlige, siger forskerne.

Det er et interessant arbejde, der har et stort potentiale. De åbenlyse applikationer er i scenarier, hvor billeder med synligt lys svigter - under dårlige lysforhold og bag lukkede døre.

Men der er også andre applikationer. Et problem med billeder med synligt lys er, at folk er genkendelige, hvilket rejser spørgsmål om privatlivets fred.



Men et radiosystem har ikke opløsningen til ansigtsgenkendelse. At identificere handlinger uden at genkende ansigter rejser ikke den samme frygt for privatlivets fred. Det kan bringe handlingsgenkendelse til folks hjem og give mulighed for dets integration i smart home-systemer, siger Li og co. Det kunne bruges til at overvåge en ældre persons hus og advare de relevante tjenester om et fald, for eksempel. Og det ville den gøre uden større risiko for privatlivets fred.

Det er ud over mulighederne for nutidens vision-baserede systemer.

Ref: arxiv.org/abs/1909.09300 : At gøre det usynlige synligt: ​​Handlingsgenkendelse gennem vægge og okklusioner

skjule