211service.com
Mere nøjagtig videosøgning
Boston-baseret opstart EveryZing har lanceret en søgemaskine, som de håber vil ændre den måde, som folk søger efter lyd og video online. EveryZing, tidligere kendt som PodZinger, en podcast-søgemaskine, udnytter talesystemer udviklet af teknologivirksomheden BBN der kan konvertere talte ord til søgbar tekst med omkring 80 procents nøjagtighed. Dette overgår andre kommercielt tilgængelige systemer, siger EveryZing CEO Tom Wilde.

Lydsignaler: En ny video- og lydsøgemaskine kan konvertere lyd til en tekstudskrift med 80 procents nøjagtighed. Det er godt nok til at vise uddrag af transskriptionen, dirigere brugerne til det sted i filen, hvor en søgeterm optræder, og opsummere nøglebegreber.
Denne høje nøjagtighed muliggør nye søgefunktioner, siger Wilde, såsom evnen til at levere hele transskriptioner af video og lyd, og evnen til at dirigere folk til det nøjagtige sted i en fil, hvor et ord eller en sætning bliver talt. Teknologien vil også lade virksomheden levere målrettede annoncer forbundet med specifikt indhold, meget på den måde, som Google leverer annoncer baseret på teksten på en webside.
Den store udfordring [i online video og lyd] … er uigennemsigtigheden af medieindhold, siger Wilde. Det er ekstremt svært at vide, hvilken række af indhold der er inde i et video- eller lydklip. Det problem, vi ønsker at løse, siger han, er opdagelsen af multimedier inden for websøgning. EveryZing gør dette ved at udtrække indholdet af multimediefiler og udskrive tekst, så det kan drage fordel af de allerede eksisterende tekstsøgningsværktøjer udviklet af Google og Yahoo.
Nettet eksploderer med multimedier fra YouTube, podcasts, tv-nyhedsrapporter og nationale offentlige radioprogrammer. Men det er stadig svært at søge efter Barack Obama og hente alle de forekomster på nettet, hvor hans navn er nævnt. Typisk indeholder titlerne på klip og de tags, som folk tildeler dem, ikke nok information til at give nyttige søgeresultater. Og det er grunden til, at en håndfuld virksomheder i løbet af de sidste par år har udforsket at bruge lydindhold som en guide. For eksempel videosøgemaskine Blinkx bruger talegenkendelsesteknologi til at gennemsøge hele internettet for relevant indhold og samle det på et enkelt websted, ligesom Google samler websider. (Se Surfe TV på internettet.)
EveryZings forretningsmål adskiller sig fra Blinkx's, siger Wilde, og han formoder, at de to tilgange kan supplere hinanden. Vi handler om merchandising af indhold, ikke trolling på nettet, siger han. EveryZing (som ligesom Blinkx tilbyder en søgeportal for websurfere) ønsker primært at indgå partnerskab med indholdsudbydere for at gøre deres multimedie søgbare. For eksempel ønsker virksomheden at konvertere alt lyd- og videoindhold i ABC.com til søgbar tekst, tilføje tidsstempler til den tekst (såvel som allerede eksisterende lukket underteksttekst), så en person straks kan hoppe til et bestemt ord i en klip.
Derudover, i modsætning til Blinkx’ nuværende teknologi, lader BBN’s teknologi EveryZing udtrække koncepter på højt niveau, som oprindeligt måske ikke var blevet søgt efter. Hvis nogen søgte efter Barack Obama, for eksempel, kan EveryZing også tilbyde andre nøgleord i klippet, såsom rally.
Ideen om at bruge lydtransskriptioner til at søge efter multimedier har eksisteret i forskningslaboratorier i årtier, og grundlæggende talegenkendelsesforskning går endnu tidligere tilbage. Meget af det afgørende arbejde fandt sted på BBN, MIT, Carnegie Mellon University, IBM og SRI International. I 1995 havde Carnegie Mellon en fungerende demonstration af et lignende videosøgesystem, siger Richard Stern , professor i el- og computerteknik ved universitetet. Dette system, kaldet Informedia , ansporede anden forskning på området, siger han, og var forløberen for BBNs moderne videoanalysetilgang.
EveryZings underliggende teknologi er sammensat af to grundlæggende teknologier fra Boston-baserede BBN. Det centrale tale-til-tekst-system, kaldet Byblos, er blevet finansieret med 50 millioner dollars i forskningspenge baseret på en række offentlige bevillinger over de seneste fem år, siger Wilde. Ved at bruge probabilistiske maskinlæringsalgoritmer tager systemet et minut at konvertere hvert minuts lydindhold til tekst.
Den anden del af teknologien, siger Wilde, er de algoritmer, der behandler tekstens indhold. BBNs naturlige sprogteknologi indeholder enorme lagre af sætninger og ord til kontekst, hvilket hjælper det med at give mening i en video. For eksempel kan et nyhedssegment om sundhed bruge sprog, der er specifikt for det medicinske område. I dette tilfælde ville systemet være i stand til at genkende visse obskure ord. At forstå betydningen af teksten er et kraftfuldt værktøj, siger Wilde, fordi det lader EveryZing levere koncepter på højt niveau til brugerne, så de kan finjustere deres søgning. Og vigtigst af alt, det gør det muligt for virksomheden at parre målrettede annoncer med det rigtige indhold.
Tiden er inde til en videosøgemaskine med disse muligheder, siger Carnegie Mellon's Stern. Video er et meget mere overbevisende og underholdende medie end blot almindelig tekst, siger han, og nu er så meget af det tilgængeligt på internettet. Han tilføjer, at BBN's 80 procent nøjagtighed er virkelig noget af en bedrift, og det burde være tilstrækkeligt til at søge i indholdet på nettet.
Selvom teknologien er god, er den ikke perfekt, siger EveryZing's Wilde. Nøjagtigheden falder, når der er baggrundsmusik, og hvis der er flere mennesker, der taler på én gang. Men for infotainment- og nyhedsmarkedet, som virksomheden retter sig mod lige nu, burde teknologien tilbyde en væsentlig forbedring i forhold til, hvad der er tilgængeligt i øjeblikket, siger han. Jeg tror, vi vil se tilbage om et par år og sige: 'Selvfølgelig skal indholdet af multimediefiler være søgbart,' siger Wilde. Det ville være, som om websiderne kun kunne søges efter titel og tag.