Det næste store skridt for AI? Forstå video

Et skærmbillede fra en af ​​videoerne i Moments in Time-datasættet, som kunne hjælpe AI bedre med at forstå videoindhold. Moments in Time Datasæt





For en computer er det ret smart at genkende en kat eller en and på et stillbillede. Men en stivere test for kunstig intelligens vil være forståelse, når katten kører på en Roomba og jagter anden rundt i et køkken .

MIT og IBM har i denne uge frigivet et stort datasæt af videoklip møjsommeligt kommenteret med detaljer om den handling, der udføres. Det Moments in Time Datasæt omfatter tre sekunders uddrag af alt fra fiskeri til break-dance.

Mange ting i verden ændrer sig fra det ene sekund til det andet, siger Aude Oliva , en hovedforsker ved MIT og en af ​​folkene bag projektet. Hvis du vil forstå, hvorfor noget sker, giver bevægelse dig en masse information, som du ikke kan fange i en enkelt ramme.



Det nuværende boom inden for kunstig intelligens blev til dels udløst af succes med at lære computere at genkende indholdet af statiske billeder ved at træne dybe neurale netværk på store mærkede datasæt (se The Revolutionary Technique That Quietly Changed Machine Vision Forever).

AI-systemer, der fortolker video i dag, inklusive de systemer, der findes i nogle selvkørende biler, er ofte afhængige af at identificere objekter i statiske billeder frem for at fortolke handlinger. Mandag lancerede Google et værktøj, der er i stand til at genkende objekterne i video som en del af sin Cloud Platform, en tjeneste, der allerede inkluderer AI-værktøjer til behandling af billede, lyd og tekst.

Den næste udfordring kan være at lære maskiner at forstå ikke bare, hvad en video indeholder, men også hvad der sker i optagelserne. Det kunne have nogle praktiske fordele, måske føre til effektive nye måder at søge, kommentere og udvinde videooptagelser på. Det handler også om at give robotter eller selvkørende biler en bedre forståelse af, hvordan verden omkring dem udvikler sig.



MIT-IBM-projektet er faktisk blot et af flere videodatasæt designet til at anspore til fremskridt i træningsmaskiner til at forstå handlinger i den fysiske verden. Sidste år udgav Google for eksempel et sæt otte millioner taggede YouTube-videoer kaldet YouTube-8M. Facebook er ved at udvikle et annoteret datasæt af videohandlinger kaldet scener, handlinger og objekter.

Olga Russakovsky, en assisterende professor ved Princeton University, som har specialiseret sig i computervision, siger, at det har vist sig vanskeligt at udvikle nyttige videodatasæt, fordi de kræver mere lagring og computerkraft, end stillbilleder gør. Jeg er spændt på at lege med disse nye data, siger hun. Jeg synes, at længden på tre sekunder er fantastisk – den giver tidsmæssig kontekst, samtidig med at lager- og beregningskravene holdes lave.

Andre tager en mere kreativ tilgang. Tyve milliarder neuroner , en startup baseret i Toronto og Berlin, skabte et brugerdefineret datasæt ved at betale crowdsourcede arbejdere for at udføre simple opgaver. En af virksomhedens medstiftere, Roland Memisevic , siger, at den også bruger et neuralt netværk, der er designet specifikt til at behandle information om tidssyn.

Netværk trænet på de andre datasæt kan fortælle dig, om videoen viser en fodboldkamp eller en fest, siger han. Vores netværk kan fortælle dig, om nogen lige er kommet ind i lokalet.

Danny Gutfreund, en forsker hos IBM, som samarbejdede om projektet, siger, at genkendelse af handlinger effektivt vil kræve, at maskiner lærer om, for eksempel, en person, der foretager en handling, og overfører denne viden til et tilfælde, hvor for eksempel et dyr udfører den samme handling. Fremskridt på dette område, kendt som transfer learning, vil være vigtigt for AIs fremtid. Lad os se, hvordan maskiner kan lave denne transferlæring, denne analogi, som vi gør meget godt, siger han.

Gutfreund tilføjer, at teknologien kunne have praktiske anvendelser. Man kunne bruge det til ældrepleje, fortælle, om nogen er faldet, eller om de har taget deres medicin, siger han. Du kan tænke på enheder, der hjælper blinde mennesker.

skjule