211service.com
Software lærer at tagge billeder
Amerikanske forskere har udgivet et nyt onlineprogram til automatisk at mærke billeder efter deres indhold. I sin første test i den virkelige verden behandlede programmet tusindvis af offentligt tilgængelige billeder, der var tilgængelige på fotodelingssiden Flickr . Der blev genereret mindst ét nøjagtigt mærke for 98 procent af alle de analyserede billeder.
Den nye software, kaldet ALIPR (Automatisk sproglig indeksering af billeder), bruger en kombination af statistiske teknikker til at behandle et billede og tildele det en batch på 15 ord, arrangeret i rækkefølge efter opfattet relevans. Disse ord kan referere til et specifikt objekt i billedet, såsom en person eller bil, eller til et mere generelt tema, såsom udendørs eller menneskeskabt.
For mennesker er det vildledende simpelt at dechifrere et billede. Og alligevel for computere, som kan sortere gennem millioner af tekstdokumenter med forbløffende hastighed og nøjagtighed, er det stadig en djævelsk vanskelig opgave at identificere indholdet af et billede.
At erkende, hvad et billede handler om semantisk, er et af de sværeste problemer inden for kunstig intelligens, siger Jia Li, en matematiker ved Pennsylvania State University, i State College, som skabte softwaren sammen med kollegaen James Wang, medlem af College of Information Sciences og Teknologi. Objekter i den virkelige verden er 3D, forklarer Li. Når de vises på et billede, kan de variere meget i farve, form, gestus, størrelse og position, og en computer har normalt ingen forudgående viden om variationerne.
Fordi en kompleks forståelse af verden forbliver uden for computeres evne, er der behov for mere effektive vision-behandlingsalgoritmer for at hjælpe dem med at efterligne menneskets syn og intelligens.
ALIPR analyserer et billede pixel for pixel og anvender en ny statistisk metode til at beregne sandsynligheden for, at et bestemt ord kan beskrive dets indhold. Dette involverer at undersøge fordelingen af farve og tekstur i billedet og sammenligne disse funktioner med en lagret database med ord og billeder. Li og Wang trænede deres program ved hjælp af en kommerciel database med omkring 50.000 billeder, der allerede var blevet tagget.
For nylig testede de ALIPR på 5.411 hidtil usete billeder tilgængelige på det populære billeddelingssite Flickr. For 51 procent af disse billeder dukkede det første ord genereret af ALIPR op i brugernes tags. Programmet producerede også mindst ét præcist ord 98 procent af tiden. Forskerne brugte billeder, der var offentligt tilgængelige af Flickr-brugere, som også var åbent tilgængelige via Flickrs egen Application Programming Interface.
Bedre billedgenkendelsessoftware kunne have en række applikationer, siger Li. Det kunne for eksempel forbedre internetsøgemaskiner eller automatisk tagge digitale billedsamlinger. Li mener, at det også kan hjælpe videnskabsmænd med at sortere gennem store mængder visuel information: Billedklassificering er nogle gange et behov i videnskabelige undersøgelser. Uden computerhjælp skal forskere manuelt klassificere billeder, og denne proces kan være langsom og komme bagud i forhold til den høje gennemstrømning af nye billeder.
De underliggende algoritmer kunne måske egne sig til forskellige andre vanskelige computeropgaver. Lignende tilgange kan anvendes til videoanalyse og muligvis andre problemer, tilføjer Li.
Louis von Ahn , en assisterende professor i datalogi ved Carnegie Mellon University i Pittsburgh, PA, siger, at forskningen er et skridt i den rigtige retning, men at softwarens nøjagtighed skal forbedres. Han bemærker, at billeder på sider som Flickr ofte indeholder meget lignende materiale. Sandheden i sagen er, at disse billeder stort set handler om det samme - folk tager for det meste billeder af andre mennesker, siger han. Så bare at bruge ordet 'mennesker' mærker allerede en stor procentdel af billederne korrekt.
Von Ahn mener også, at mennesker kunne spille en større rolle i træningen af synsgenkendelsesalgoritmer. Han driver et websted kaldet Peekaboom der gør tagging af billeder til et spil for to onlinespillere. Efterhånden som et billede langsomt afsløres, skal hver spiller race for at finde det rigtige tag til det. Dette hjælper med at træne von Ahns software til at identificere billeder ved at fokusere på nøgledele. Indtil videre er cirka 100.000 individuelle billeder blevet klassificeret ved hjælp af Peekaboom, siger von Ahn.
Alexander Berg , en computersynsekspert baseret på University of California i Berkley, er enig i, at mennesker kunne hjælpe computere med at forstå komplekse data bedre. Han foreslår, at de tags, der vises på websteder som Flickr og YouTube, såvel som på mange blogs og nyhedswebsteder, kan vise sig at være afgørende for denne bestræbelse i fremtiden. Generelt er billed- og videosøgning et område, der kræver store fremskridt, siger Berg. Flere og flere data er online med en vis mængde menneskelig mærkning.
Det er en idé, der hilses velkommen af Li: Jo mere pålidelige data vi kan få adgang til og bruge, jo bedre.