Akademisk søgemaskine forstår mening

Hvis computere kan læres at finde mening i de tusindvis af forskningsartikler, der udgives hvert år, så kunne de måske automatisk fremhæve vigtige nye tendenser eller opdagelser og drage konklusioner ud fra dem.





Det Allen Institute for Artificial Intelligence arbejder hen imod netop dette mål og har udviklet et nyt værktøj kaldet Semantisk lærd der kan søge gennem millioner af computervidenskabelige artikler. Værktøjet, der blev lanceret i dag, byder på måder at forfine søgninger på baseret på information udtrukket fra teksten i papirer.

Det er f.eks. muligt at indsnævre en søgning i forhold til det tidsskrift, hvor et indlæg er udgivet, eller den konference, hvor det blev præsenteret, eller efter det anvendte datasæt. Semantisk lærd vil også vise nøglesætninger i et papir.

Mange akademiske søgemaskiner findes allerede, blandt dem Google Scholar , Microsoft Academic Search , PubMed , og JSTOR . Men disse søger typisk kun gennem papirer ved hjælp af nøgleord og anden information, der er klart kategoriseret, såsom udgivelsesdatoen.



Oren Etzioni , administrerende direktør for Allen Institute, siger, at en masse relevant information, der findes i forskningsartikler, præsenteres på forskellige måder. Softwaren bag Semantic Scholar blev trænet til at udtrække forskellige koncepter ved hjælp af en række maskinlæringsteknikker. Med millioner af papirer, der dukker op hvert år, kan du bare ikke følge med dem, siger Etzioni. Så du har brug for en vis grad af forståelse.

Der er en stigende interesse for at bruge maskinlæring til at træne computere til at genkende bestemte begreber i data. Google bygger en såkaldt vidensgraf over koncepter ved at træne algoritmer til at crawle nettet og udtrække nyttig information. Det er derfor, når du søger efter Hvor gammel er Barack Obama, vil Google ikke kun vise websider, der kan indeholde oplysningerne, men også fortælle dig direkte, at han er 54 år gammel.

Andre virksomheder forsøger at gøre noget lignende med akademiske papirer. Et firma ringede Meta annoncerede også i dag en tjeneste, der automatisk vil identificere de personer og enheder, der er nævnt i medicinsk litteratur. Meta bruger teknologi udviklet af SRI gennem et projekt kaldet FUSE til at forudsige videnskabelige tendenser ved hjælp af maskinlæring.



Metas administrerende direktør, Sam Molyneux, siger, at tjenesten, som går live senere i denne uge, kan anbefale papirer til en bruger baseret på koncepterne i et papir, de tidligere har læst, og kan endda identificere nye teknologier automatisk. I det væsentlige giver det dig mulighed for at spore på konceptniveau eller teknologiniveau snarere end artikelniveau, siger Molyneux. Koncepter som CRISPR-teknologien, som virkelig revolutionerer, hvordan genomteknologi foregår lige nu - vi tog det op som et spirende koncept for et antal år siden.

Etzioni siger, at målet for Semantic Scholar er at gå videre ved at give computere en meget dybere forståelse af nye videnskabelige publikationer. Hans team udvikler algoritmer, der læser grafer eller diagrammer i papirer og forsøger at udtrække værdierne deri. Vi ønsker i sidste ende at være i stand til at tage et eksperimentelt papir og sige: 'Okay, skal jeg læse dette papir, eller kan computeren fortælle mig, at dette papir viste, at netop dette lægemiddel var yderst effektivt?'

skjule