Når AI leverer lyden i videoklip, kan mennesker ikke se forskel

Maskinlæring ændrer måden, vi tænker om billeder på, og hvordan de skabes. Forskere har trænet maskiner til at generere ansigter, til at tegne tegneserier og endda til at overføre maleriets stil til billeder. Det er kun et kort skridt fra disse teknikker til at skabe videoer på denne måde, og det bliver faktisk allerede gjort.





Alt dette peger på en måde at skabe virtuelle miljøer udelukkende på maskine. Det åbner alle slags muligheder for fremtiden for menneskelig erfaring.

Men der er et problem. Video er ikke kun en visuel oplevelse; at generere realistisk lyd er lige så vigtigt. Så et interessant spørgsmål er, om maskiner på overbevisende måde kan generere lydkomponenten i en video.

I dag får vi et svar takket være arbejdet fra Yipin Zhou og venner ved University of North Carolina ved Chapel Hill og et par venner hos Adobe Research. Disse fyre har trænet en maskinlæringsalgoritme til at generere realistiske lydspor til korte videoklip.



Faktisk er lydene så realistiske, at de narre de fleste mennesker til at tro, at de er ægte. Du kan tag selv en test her for at se om du kan se forskel.

Holdet tager standardtilgangen til maskinlæring. Algoritmer er kun altid så gode som de data, der bruges til at træne dem, så det første skridt er at skabe et stort annoteret datasæt af høj kvalitet af videoeksempler.

Holdet opretter dette datasæt ved at vælge et undersæt af klip fra en Google-samling kaldet Audioset, som består af over to millioner 10-sekunders klip fra YouTube, der alle inkluderer lydbegivenheder. Disse videoer er opdelt i menneskemærkede kategorier med fokus på ting som hunde, motorsave, helikoptere og så videre



For at træne en maskine skal holdet have klip, hvor lydkilden er tydeligt synlig. Så enhver video, der indeholder lyd fra begivenheder uden for skærmen, er uegnet. Holdet filtrerer disse fra ved hjælp af crowdsourcede arbejdere fra Amazons Mechanical Turk-tjeneste til at finde klip, hvor lydkilden er tydeligt synlig og dominerer soundtracket.

Det producerede et nyt datasæt med over 28.000 videoer, hver omkring syv sekunder lange, dækkende 10 forskellige kategorier.

Derefter brugte holdet disse videoer til at træne en maskine til at genkende de bølgeformer, der er forbundet med hver kategori, og til at gengive dem fra bunden ved hjælp af et neuralt netværk kaldet SampleRNN.



Til sidst testede de resultaterne ved at bede menneskelige evaluatorer om at vurdere kvaliteten af ​​lyden, der ledsager en video, og for at afgøre, om den er ægte eller kunstigt genereret.

Resultaterne tyder på, at maskiner kan blive ret gode til denne opgave. Vores eksperimenter viser, at de genererede lyde er ret realistiske og har god tidsmæssig synkronisering med de visuelle input, siger Zhou og co.

Og menneskelige evaluatorer synes at være enige. Evalueringer viser, at over 70 % af den genererede lyd fra vores modeller kan narre mennesker til at tro, at de er ægte, siger Zhou og co.



Det er interessant arbejde, der baner vejen for automatiseret lydredigering. Et almindeligt problem i videoer er, at fremmed støj fra en kilde uden for skærmen kan ødelægge et klip. Så det vil være nyttigt at have en måde at erstatte lyden automatisk med et realistisk maskingenereret alternativ.

Og med Adobes involvering i denne forskning kan det ikke vare længe, ​​før vi ser denne form for kapacitet i kommerciel videoredigeringssoftware.

Ref: arxiv.org/abs/1712.01393 : Visual to Sound: Generering af naturlig lyd til videoer i naturen

skjule