Sætte internettet i et regneark

Store mængder data er frit tilgængelige på nettet, og det kan være en potentiel skatkammer for mange virksomheder – forudsat at de kan finde ud af, hvordan de kan bruge dem effektivt.





Sortering og filtrering: BigSheets lader brugere analysere ustrukturerede data fra nettet ved hjælp af værktøjer, der ligner dem, der findes i desktop regnearkssoftware.

En virksomhed kan f.eks. gennemsøge data fra U.S. Patent and Trademark Office og domstolsregistre, inden de opkøber en anden virksomhed, for at se, om nogen af ​​dens intellektuelle ejendom er bundet til retssager. I praksis tager det dog tid og kræfter at orkestrere at gennemgå så meget information.

IBM håber, at et nyt værktøj, kaldet BigSheets , vil hjælpe brugere med at analysere webdata lettere. Virksomheden har udviklet en testversion af softwaren til British Library.



Enhver brugers evne til at lave deres egne typer af interessante analyser er ved at blive voksen, siger Rod Smith, vicepræsident for nye internetteknologier for IBM.

BigSheets er bygget oven på et andet stykke software kaldet Hadoop. Dette er en open source-platform til behandling af meget store mængder webdata ved at opdele opgaver og videregive dem til en klynge af forskellige computere. Hadoop bruges ofte til at analysere store mængder ustrukturerede webdata.

BigSheets bruger Hadoop til at gennemgå websider og analysere dem for at udtrække nøgleord og andre nyttige data. BigSheets organiserer disse oplysninger i et meget stort regneark, hvor brugerne kan analysere dem ved hjælp af den slags værktøjer og makroer, der findes i desktop regnearkssoftware. I modsætning til almindelig regnearkssoftware er der dog ingen grænse for størrelsen af ​​et regneark, der er oprettet gennem BigSheets.



For at bruge BigSheets vil en bruger pege værktøjet mod et sæt URL'er eller et datalager. Lister over termer kan bruges til at organisere dataene i rækker og tabeller, og disse kan justeres senere.

Smith siger, at IBM valgte regnearket som model til at organisere data, fordi de fleste brugere allerede er bekendt med sådan software. Hvis brugerne ønsker at repræsentere dataene på mere komplekse måder, vil værktøjet arbejde med et IBM visualiseringsværktøj kaldet Mange øjne , samt anden visualiseringssoftware.

Tag team: Visualiseringsværktøjer kan bruges sammen med BigSheets til at finde mønstre i ustrukturerede data.



BigSheets har et integrationsniveau, som jeg ikke har set, siger Jeg er Lorica , senioranalytiker i forskningsgruppen hos det tekniske forlag O'Reilly Media. Traditionelt, siger Lorica, har virksomheder opdelt de funktioner, som BigSheets udfører, i tre separate opgaver – webcrawling, dataanalyse og visualiseringer. Fordi BigSheets er bygget på Hadoop, som grundlæggende er designet til at arbejde på enorme mængder data, siger Lorica, er skala ikke et problem for BigSheets.

Han advarer dog om, at BigSheets er på et tidligt tidspunkt og skal testes med andre data. Da teknologien udvikles i samarbejde med særlige partnere fra IBM, er det uklart, hvor nemt det ville være for en virksomhed at begynde at bruge den, siger han. At oprette en Hadoop-klynge kan være en krævende opgave, siger han, og hvis BigSheets ikke er pakket godt ind, kan virksomheder finde på at få brug for en hær af konsulenter til at forberede vejen for værktøjet.

Den første test for BigSheets kom på British Library, som siden 2004 har arbejdet på at skabe et arkiv over de omkring otte millioner britiske websteder. Med jævne mellemrum tager biblioteket snapshots af websider, konverterer dem til et arkivfilformat og gemmer dem. Men at søge og analysere disse data er en anden udfordring, og det var her, BigSheets kom ind.



På mindre end otte timer, siger Smith, tog hans team 4,5 terabyte arkivfiler og behandlede dem ved hjælp af en Hadoop-klynge med fire maskiner. Med vejledning fra British Library-forskere brugte holdet BigSheets til at udtrække nøgleord, forfatterinformation og andre metadata fra disse ustrukturerede websider. De eksperimenterede med term frekvensanalyse og kørte tag-skyer og andre visualiseringer.

British Library-forskerne var i stand til at justere den slags metadata, de var interesserede i i løbet af den første dag, og fokuserede mere på, hvem der havde forfattet sider, end de oprindeligt havde til hensigt. Visualiseringer gav ny indsigt. For eksempel, ved hjælp af en tag-sky, opdagede forskerne, at navnet på britisk politisk figur og forfatter Alastair Campbell blev ofte stavet forkert som Alistair, og viste et stort antal relevante poster, der nemt kunne være blevet overset.

Eytan Adar , en assisterende professor i information og computervidenskab ved University of Michigan, som forsker i internetskalasystemer, tekstmining og visualisering, siger, at værktøjet kan have en stor indflydelse. Selvom British Librarys indhold ser ud til at være begrænset til et par øjebliksbilleder for hver side, oversættes dette stadig til et væld af data, og det er ikke nyttigt at dumpe søgeresultater som svar på en forespørgsel, siger Adar.

Adar har designet sit eget værktøj, kaldet Zoetrope , for at analysere, hvordan websider har ændret sig over tid. BigSheets bringer ny indsigt, siger han, ved at sammenligne data fra mange forskellige sider såvel som over tid. Adar siger, at effektive visualiseringer er afgørende for, at brugerne hurtigt kan forstå store datasamlinger.

Efter yderligere test håber IBM at inkorporere BigSheets i sine eksisterende tjenester og produkter.

skjule