En webedderkop for alle

I takt med at mængden af ​​information på internettet fortsætter med at vokse, vokser spørgsmålet om, hvordan man behandler det hele og gør det nyttigt. En startup kaldet 80 ben , der er baseret i Houston, TX, håber, at en billig, distribueret webcrawling-tjeneste kan hjælpe startups med at udvinde nettet for information uden at skulle bygge de gigantiske serverfarme, der bruges af store søgemaskiner. Virksomheden lancerede i denne uge på DEMO, en konference i San Diego, der fremviser nye virksomheder.





Webcrawlere, eller edderkopper, er software, der automatisk besøger sider på internettet og kan bruges til at indeksere dem og samle informationer fra forskellige sider. Crawlere bruges af søgemaskiner, for eksempel til at overvåge placeringen af ​​information på nettet. Men nettets omfang betyder, at omfattende crawling bruger meget processorkraft, hvilket typisk betyder, at der skal bygges enorme datacentre til at drive softwaren.

80legs håber at gøre denne teknologi mere tilgængelig for små virksomheder og enkeltpersoner ved at tillade leasingadgang og lade kunderne kun betale for det, de gennemgår.

Webcrawling-teknologi er også afgørende for semantiske websteder og tjenester designet til at behandle forespørgsler på naturligt sprog. Mens 80legs forventer at se brugere interesseret i søge- og semantiske applikationer, siger CEO Shion Deysarkar, at de, der testede tjenesten, også omfattede kunder med mindre tekniske interesser. Nogle markedsforskere bruger for eksempel 80legs til at afdække omtaler af specifikke virksomheder eller emner på tværs af nettet.



En bruger kan starte en webcrawl gennem 80legs' webbaserede grænseflade. Formularen på virksomhedens websted lader dem indstille parametre for projektet og uploade tilpasset kode, der er nødvendig for at kontrollere, hvordan crawleren udfører sit arbejde. For eksempel vil en bruger måske have, at crawleren skal finde billeder og kontrollere dem mod en database med ophavsretligt beskyttede billeder. Deysarkar siger, at hans virksomheds crawlere er i stand til at behandle op til to milliarder sider om dagen. Virksomheden opkræver $2 for hver million sider, der gennemgås, plus et gebyr på tre cents pr. time anvendt behandling.

Mange startups kæmper for at finde den nødvendige finansiering til at bygge store datacentre, men det er ikke den tilgang, 80legs tog for at konstruere sin webcrawl-infrastruktur. Virksomheden kører i stedet sin software på et distribueret netværk af personlige computere, ligesom dem der bruges til projekter som f.eks.SETI @ home. Det distribuerede computernetværk er sat sammen af ​​Plura Processing, som lejer det ud til 80legs. Plura får computerbrugere til at levere ubrugt processorkraft i bytte for adgang til spil, donationer til velgørende organisationer og andre belønninger.

Deysarkar siger, at tilgangen reducerer omkostningerne for 80 legs betydeligt, hvilket gør det muligt for virksomheden at tilbyde sin service for langt mindre, end det ville være muligt, hvis det brugte et datacenter eller endda en cloud-computing-tjeneste som Amazon Web Services.



Daniel Tunkelang, medstifter af søgefirmaet Endeca , baseret i Cambridge, MA, siger, at en god webcrawling-tjeneste kunne være nyttig for startups, der ønsker at fokusere på at opbygge søgeoplevelsen i stedet for at indsamle data. Men Tunkelang siger, at succesen med 80legs kan afhænge af, hvor nemt det er for brugerne at tilpasse gennemgangen. Det store spørgsmål er, hvor adaptiv og programmerbar er gennemgangen? han siger.

Tunkelang bemærker også, at det er vigtigt for en webcrawler at fange så meget information som muligt. For eksempel kan den sti, en crawler tog for at nå frem til en bestemt side, give en søgevirksomhed nyttige oplysninger om indholdet af den pågældende side.

En service som 80legs kunne også være nyttig for universitetsforskere. At kravle i stor skala er faktisk en dyr hindring at krydse for eksperimentelle søgeprojekter i den akademiske verden, som ofte mangler storskala infrastruktur, siger Kevin Chang , lektor i datalogi ved University of Illinois i Urbana-Champaign.

Chang synes, at 80legs' fordelte karakter er en interessant retning og lyder lovende [for at sænke] omkostningerne ved at kravle. Han er samtidig enig i, at meget afhænger af, hvor effektivt systemet fungerer, og hvor effektivt brugerne kan tilpasse, hvilke data de vil behandle.

80legs planlægger at lancere et marked, hvor ikke-tekniske brugere vil kunne købe applikationer, der kan kontrollere, hvordan en crawler fungerer. Partnervirksomheder vil også kunne sælge adgang til applikationer, der styrer 80legs's crawlere.

skjule