En gratis database over hele nettet kan skabe den næste Google

Google startede som berømt som lidt mere end en mere effektiv algoritme til rangering af websider. Men virksomheden byggede også sin succes på at crawle internettet – ved hjælp af software, der besøger hver side for at opbygge et stort indeks af onlineindhold.





En nonprofit ringede Almindelig kravle bruger nu sin egen webcrawler og laver en kæmpe kopi af internettet, som den gør tilgængelig for alle. Organisationen tilbyder over fem milliarder websider, der er gratis tilgængelige, så forskere og iværksættere kan prøve ting, der ellers kun er muligt for dem, der har adgang til ressourcer på størrelse med Googles.

Nettet repræsenterer, så vidt jeg ved, den største ophobning af viden, og der er så meget, man kan bygge ovenpå, siger iværksætter Gilad Elbaz, der har grundlagt Common Crawl. Men blot at udføre den enorme mængde arbejde, der er nødvendig for overhovedet at få den information, er en stor blokering; få organisationer … har haft ressourcerne til at gøre det.

Nye søgemaskiner er blot en af ​​de ting, der kan bygges ved hjælp af et indeks over nettet, siger Elbaz, som påpeger, at Googles oversættelsessoftware blev trænet ved hjælp af onlinetekst tilgængelig på flere sprog. Den eneste måde, de kunne gøre det på, var ved at starte med en massiv crawl. Det har sat dem på vej til at bygge Star Trek oversætter, siger han. At have et åbent, delt korpus af menneskelig viden er simpelthen en måde at demokratisere adgangen til information, der er grundlæggende for innovation.



Elbaz siger, at han bemærkede for omkring fem år siden, at forskere med nye ideer om, hvordan man bruger webdata, følte sig tvunget til at tage job hos Google, fordi det var det eneste sted, de kunne teste disse ideer. Han siger, at Common Crawls data vil gøre det lettere for nye ideer at vinde indpas, både i startup-verdenen og i akademisk forskning.

Elbaz er grundlægger og administrerende direktør for big data-virksomheden Faktuel , og før det grundlagde en virksomhed købt af Google for at være grundlaget for dets annoncevirksomhed for websider. Common Crawl har også Googles forskningsdirektør, Peter Norvig , og MIT Media Lab-direktør Joi Ito i sit advisory board.

Common Crawl har indtil videre indekseret mere end fem milliarder sider, hvilket tilføjer op til 81 terabyte data, gjort tilgængeligt gennem Amazons cloud computing-tjeneste. For omkring $25 kunne en programmør oprette en konto hos Amazon og komme i gang med at knuse Common Crawl-data, siger Lisa Green, Common Crawls direktør. Det Internetarkiv , en anden nonprofitorganisation, kompilerer også en kopi af internettet og tilbyder en tjeneste kaldet Wayback maskine der kan vise gamle versioner af en bestemt side. Det tillader dog ikke nogen at analysere alle dets data på én gang på den måde.



Common Crawl har allerede inspireret eller hjulpet nogle nye web-startups. TinEye , en omvendt søgemaskine, der finder billeder, der ligner dem, der er leveret af brugeren, gjorde brug af tidlige Common Crawl-data for at komme i gang. En programmørs personlige projekt, der bruger Common Crawl-data til at måle, hvor mange af internettets sider, der forbinder til Facebook— omkring 22 procent, konkluderede han — førte til, at han sikrede finansiering til en startup, Lucky Oyster , baseret på at hjælpe folk med at finde nyttige oplysninger i deres sociale data.

Andre ideer, der blev muliggjort af projektet, kom fra en konkurrence, der blev kørt sidste år, der uddelte priser for bedste use cases . En af vinderne brugte Wikipedia-links i crawl-data til at bygge en tjeneste, der er i stand til at definere betydningen af ​​ord; en anden forsøgte at fastslå offentlige holdninger til kongressens lovgivning ved at analysere indholdet af online diskussioner om nye love.

Rich Skrenta, medstifter og administrerende direktør for opstart af søgemaskiner Blekko (se As Google Tinkers With Search, Upstarts Gain Ground), siger Common Crawls data opfylder et bestemt behov i startup-fællesskabet. Han siger, at Blekko er blevet kontaktet af startups med teknologi, der har brug for adgang til store samlinger af onlinedata. Den slags data er nu let tilgængelige fra Common Crawl, siger Skrenta, hvis virksomhed bidrog med nogle af sine egne data til projektet i december 2012. Blekko delte information fra sit system, der kategoriserer websider efter indhold, for eksempel mærkning af, om de indeholder pornografi eller spam.



Ben Zhao , en lektor ved University of California, Santa Barbara, som bruger store samlinger af webdata til forskning i aktivitet på sociale websteder (se Hidden Industry Dupes Social Media Users), siger, at Common Crawls data sandsynligvis er unikke. Friske, store crawls er ret sjældne, og jeg er ikke personligt bekendt med steder, hvor man kan få store crawl-data på nettet, siger han.

Zhao bemærker dog, at nogle af de mest interessante og værdifulde dele af internettet ikke vil være godt repræsenteret i Common Crawls data: Sociale websteder er ret følsomme over for deres indhold i disse dage, og mange implementerer anti-crawling-mekanismer for at begrænse hastigheden for nogen. kan få adgang til deres indhold.

For at få adgang til disse data skal forskere etablere relationer med virksomheder og stole på, hvad de vil frigive - en rute, der er mindre tilgængelig for startups, der kan ses som konkurrence.

skjule