211service.com
Forberedelse til Data Deluge
Fra Facebook til Department of Motor Vehicles er verden katalogiseret i databaser. Ingen ved det bedre end MIT adjungeret professor og iværksætter Michael Stonebraker , der har brugt de sidste 25 år på at udvikle den teknologi, der gjorde det til det. Han fik sit store gennembrud ved at opfinde og kommercialisere teknologi, der ligger til grund for de fleste af de databaser, kendt som relationelle databaser, der hersker i dag. Men Stonebraker kalder nu heldigvis sine tidligere opfindelser stort set forældede. Han arbejder på en ny generation af databaseteknologi, der kan håndtere den strøm af digitale data, der begynder at overvælde etablerede metoder.
Relationelle databaser er allestedsnærværende som løsningen til virksomhedsdata. De har haft fabelagtig succes, siger Stonebraker. Men han siger, at de største databaseleverandører, inklusive Oracle, IBM og Microsoft, stadig sælger sådanne produkter, som er passende for enhver virksomhed. Stonebraker har en anden opfattelse: at nye databaseteknologier er nødvendige for at håndtere de eksponentielle stigninger i den information, som virksomheder skal håndtere. Stonebraker, 67, finder allerede succes med flere af sine egne nye tilgange.
Det ene er et databasesystem kaldet C-Store . I modsætning til de fleste systemer, der bruges i dag, gemmer den data på disken kolonne for kolonne, ikke række for række. Den simple tweak krævede en fuldstændig omskrivning af, hvordan databaser har fungeret, men den hænger pænt sammen med både den måde, computerhukommelsen fungerer på, og den måde, der tilgås databaser på. Det giver meget hurtigere ydeevne og mere komprimerede data.
Denne tweak og andre lavet af Stonebraker og kolleger ved MIT, Brown, Brandeis, Yale og University of Massachusetts muliggjorde lanceringen af Vertica , en virksomhed, der kommercialiserede C-Store og hjalp kunder med at forespørge store databaser næsten i realtid. Vertica blev opkøbt af Hewlett-Packard i februar og kan prale af kunder, herunder Comcast, som bruger det til at overvåge de millioner af enheder, der udgør dets tv- og internetnetværk, og Groupon, som bruger det til at analysere sine millioner af abonnenters handlinger.
Et relateret system fra Stonebraker og nogle af de samme akademiske kolleger, H-Butik , bygger på de samme ideer med ekstra forbedringer, såsom at køre helt i en computers hukommelse, ikke på disk; denne metode er især nyttig i online transaktionsbehandling. H-Stores kode er open source, men teknologien kommercialiseres af venture-backed VoltDB , med Stonebraker som CTO. Han argumenterer for, at denne form for brugsspecifikke, bygget til hastighed databasesystem er, hvad de fleste virksomheder bliver nødt til at vedtage før snarere end senere for at håndtere oversvømmelsen af digitale data.
Nogle organisationer er allerede fanget i denne oversvømmelse. Overvej Facebook. Facebook er allerede vært for flere digitale billeder end nogen anden virksomhed, og Facebook bygger ny lager- og behandlingsinfrastruktur så hurtigt som muligt. Alligevel presser den databaseteknologien, den bruger, til det yderste, og deler dens berømte sociale graf på tværs af 4.000 databaser, der alle skal arbejde sammen som én, siger Stonebraker. De dør bare under belastningen af det ledelseslag, der skal til for at holde det her system oppe, siger han. De har det sværeste databaseproblem på planeten, og der er ikke noget nuværende system, der vil opfylde deres behov.
Løsninger, som Stonebraker bygger til en meget anden sektor, der allerede drukner i data, kan i sidste ende hjælpe. For nogle år siden hørte han om problemerne Stort synoptisk undersøgelsesteleskop under opførelse i Chile. Det kommer til at samle 100 petabyte af rådata og afledte data, siger Stonebraker, og de havde ingen anelse om, hvad de skulle gøre med så meget.
Stonebraker og samarbejdspartner David DeWitt, tilknyttet University of Wisconsin-Madison, byggede et unikt databasesystem ved navn SciDB . Open source-projektet har nu venture-opbakning og et stort fællesskab af frivillige fra videnskaben. Men Stonebraker mener, at funktioner i SciDB i sidste ende vil finde fordel ud over den akademiske verden.
Alle videnskabelige data er usikre og har fejlbjælker, i modsætning til dataene i en løndatabase, så SciDB kan være opmærksom på usikkerhed. Det kan heller ikke overskrive, for videnskabsfolk vil aldrig smide noget væk, siger han. Disse funktioner adskiller sig ikke så meget fra behovet for højdrevne, statistiktunge analyser eller datavidenskab i stigende grad i hjertet af succesrige, teknologiledede virksomheder. Et eksempel er onlineannonceplacering: målretning af hver person individuelt kræver beregningsmæssig intens analyse for at gruppere lignende personer sammen.
Stonebraker hævder dog ikke, at nye databasesystemer som dem, han arbejder på, kan være et vidundermiddel for virksomheder, der pludselig lærer grænserne for mere etablerede teknologier. Den voksende betydning af datalagring og -behandling for alle slags virksomheder vil kræve, at de gør begge dele mere til en forretningsprioritet. Hvis du driver en virksomhed, skal du ingeniør i skala fra begyndelsen, siger han, for der er ingen tvivl om, at du får brug for det senere.