211service.com
Uddrag mening fra millioner af sider
En softwaremotor, der samler fakta ved at finkæmme mere end 500 millioner websider, er blevet udviklet af forskere ved University of Washington. Værktøjet udtrækker information fra milliarder af tekstlinjer ved at analysere grundlæggende forhold mellem ord.

Ord søgning : TextRunner gennemsøger automatisk 500 millioner websider for at udtrække mening fra ordrelationer.
Nogle eksperter siger, at denne form for automatiseret informationsudtrækning sandsynligvis vil danne grundlaget for langt mere intelligent næste generations websøgning, hvor klumper af information først indsamles og derefter kombineres intelligent.
University of Washington-projektet repræsenterer en opskalering af en eksisterende teknologi udviklet dér kaldet TextRunner med hensyn til både antallet af sider og omfanget af emner, som det kan analysere.
Betydningen af TextRunner er, at den er skalerbar, fordi den er uden opsyn, siger Peter Norvig, forskningsdirektør hos Google, som har doneret databasen med websider, som TextRunner analyserer. Den kan opdage og lære millioner af relationer, ikke kun én ad gangen. Med TextRunner er der intet menneske i løkken: det finder bare relationer på egen hånd.
Norvig forklarer, at tidligere teknologier har krævet mere vejledning fra programmøren. For at finde navnene på personer, der er administrerende direktører inden for millioner af dokumenter, skal du f.eks. først træne softwaren med andre eksempler, såsom Steve Jobs er administrerende direktør for Apple, Sheryl Sandberg er administrerende direktør for Facebook. Norvig tilføjer, at Google gør lignende arbejde og bruger allerede sådan teknologi i begrænsede sammenhænge.
TextRunner slipper af med det manuelle arbejde. En bruger kan indtaste, for eksempel dræber bakterier, og motoren vil komme med sider, der giver indsigt i, at klor dræber bakterier eller ultraviolet lys dræber bakterier eller varme dræber bakterier – resultater kaldet tripler – og giver måder at se teksten på og besøg derefter den webside, den kommer fra.
Prototypen har stadig en ret simpel grænseflade og er ikke beregnet til offentlig søgning så meget som at demonstrere den automatiske udtrækning af information fra 500 millioner websider, siger Oren Etzioni , en computerforsker fra University of Washington, der leder projektet. Det, vi viser, er softwarens evne til at opnå rudimentær forståelse af tekst i et hidtil uset omfang og omfang, siger han.
Etizioni siger, at TextRunners evne til at udtrække mening hurtigt og i stor skala kom fra hans gruppes opdagelse af en generel model for, hvordan relationer udtrykkes på engelsk, der gælder uanset emnet. For eksempel dækker det simple mønster 'entity1, verb, entity2' forholdet 'Edison invented the light bulb' samt 'Microsoft erhvervede Farecast' og mange flere, siger han. TextRunner er afhængig af denne model, som automatisk læres fra tekst, til at analysere sætninger og udtrække tripler med høj nøjagtighed.
TextRunner fungerer også som udgangspunkt for at opbygge slutninger fra forespørgsler på naturligt sprog, hvilket gruppen nu arbejder på. For at give et simpelt eksempel: Hvis TextRunner finder en webside, der siger, at pattedyr er varmblodede, og en anden webside, der siger, at hunde er pattedyr, vil en slutningsmaskine producere information om, at hunde sandsynligvis er varmblodede.
Dette er analogt med teknologi udviklet af Powerset, som blev opkøbt af Microsoft sidste år. Kort før dette opkøb afslørede Powerset et værktøj, der var begrænset til at udtrække fakta fra kun omkring to mio. Wikipedia sider. TextRunner-teknologien håndterer Wikipedia-sider plus vilkårlig tekst på enhver side, inklusive blogindlæg, produktkataloger, avisartikler og mere.
Denne arbejdslinje har gjort vigtige fremskridt i den skala, hvormed disse opgaver kan gribes an, siger Jon Kleinberg, en datalog ved Cornell University, som har fulgt University of Washingtons søgeforskning. Han tilføjede, at dette arbejde afspejler en voksende tendens i retning af design af søgeværktøjer, der aktivt kombinerer de stykker information, de finder på nettet, til en større syntese.