Andrew Ng: Glem alt om at bygge en AI-first-virksomhed. Start med en mission.

Jeremy Portje





Andrew Ng har båret mange hatte i sit liv. Du kender ham måske som grundlæggeren af Google Brain-team eller den tidligere chefforsker ved Baidu . Du kender ham måske også som din egen instruktør. Han har undervist utallige studerende, nysgerrige lyttere og virksomhedsledere om principperne for maskinlæring gennem sine vildt populære onlinekurser.

Nu i sit seneste foretagende, Landende AI , som han startede i 2017, undersøger han, hvordan virksomheder uden gigantiske datasæt at trække på, stadig kan deltage i AI-revolutionen.

Den 23. marts sluttede Ng sig til MIT Technology Reviews virtuelle EmTech Digital, vores årlige AI-begivenhed, for at dele de erfaringer, han har lært.



Dette interview er blevet forkortet og let redigeret for klarhedens skyld.

MIT Technology Review: Jeg er sikker på, at folk ofte spørger dig, hvordan bygger jeg en AI-first-virksomhed? Hvad plejer du at sige til det?

Andrew Ng: Jeg plejer at sige: Gør det ikke. Hvis jeg går til et hold og siger: Hej alle sammen, vær venligst AI-først, som har en tendens til at fokusere holdet på teknologi, hvilket kan være fantastisk til et forskningslaboratorium. Men i forhold til, hvordan jeg udfører forretningen, har jeg en tendens til at være kunde- eller missionsstyret, næsten aldrig teknologi-ledet.

Du har nu dette nye foretagende kaldet Landing AI. Kan du fortælle lidt om, hvad det er, og hvorfor du valgte at arbejde på det?

Efter at have stået i spidsen for AI-teamene hos Google og Baidu, indså jeg, at AI har transformeret softwareforbrugerinternet, såsom websøgning og onlineannoncering. Men jeg ville tage kunstig intelligens til alle de andre industrier, som er en endnu større del af økonomien. Så efter at have set på en masse forskellige brancher, besluttede jeg at fokusere på fremstilling. Jeg tror, ​​at flere industrier er AI-klar, men et af mønstrene for, at en industri er mere AI-klar, er, hvis den har gennemgået en digital transformation, så der er nogle data. Det skaber en mulighed for AI-teams at komme ind for at bruge dataene til at skabe værdi.



Så et af de projekter, som jeg har været begejstret for for nylig, er fremstilling af visuel inspektion. Kan du se på et billede af en smartphone, der kommer ud af produktionslinjen og se, om der er en defekt i den? Eller se på en autokomponent og se, om der er en bule i den? En kæmpe forskel er i forbrugersoftware internet, måske har du en milliard brugere og en enorm mængde data. Men i fremstillingen har ingen fabrik fremstillet en milliard eller endda en million ridsede smartphones. Gudskelov for det. Så udfordringen er, kan du få en AI til at arbejde med hundrede billeder? Det viser sig ofte, at du kan. Jeg er faktisk blevet overrasket ret mange gange med, hvor meget du kan gøre med selv beskedne mængder data. Og så selvom al hypen og spændingen og PR omkring AI er på de gigantiske datasæt, føler jeg, at der er meget plads, vi også skal vokse for at åbne disse andre applikationer, hvor udfordringerne er helt anderledes.

Hvordan gør du det?

En meget hyppig fejl, jeg ser administrerende direktører og CIO'er begå: de siger til mig noget som Hej, Andrew, vi har ikke så meget data - mine data er noget rod. Så giv mig to år til at bygge en fantastisk it-infrastruktur. Så har vi alle disse fantastiske data at bygge AI på. Jeg siger altid, det er en fejl. Gør det ikke. For det første tror jeg ikke, at nogen virksomhed på planeten i dag - måske ikke engang teknologigiganterne - mener, at deres data er fuldstændig rene og perfekte. Det er en rejse. At bruge to eller tre år på at bygge en smuk datainfrastruktur betyder, at du mangler feedback fra AI-teamet til at hjælpe med at prioritere, hvilken it-infrastruktur der skal bygges.

Hvis du for eksempel har mange brugere, bør du så prioritere at stille dem spørgsmål i en undersøgelse for at få lidt mere data? Eller skal man på en fabrik prioritere at opgradere sensoren fra noget, der optager vibrationerne 10 gange i sekundet til måske 100 gange i sekundet? Det er ofte at begynde at lave et AI-projekt med de data, du allerede har, som gør det muligt for et AI-team at give dig feedback for at hjælpe med at prioritere, hvilke yderligere data der skal indsamles.



I brancher, hvor vi bare ikke har omfanget af forbrugersoftware internet, føler jeg, at vi skal skifte tankegang fra stor data til godt data. Hvis du har en million billeder, så brug det – det er fantastisk. Men der er masser af problemer, der kan bruge meget mindre datasæt, der er rent mærkede og omhyggeligt sammensat.

Kan du give et eksempel? Hvad mener du med gode data?

Lad mig først give et eksempel fra talegenkendelse. Da jeg arbejdede med stemmesøgning, fik du lydklip, hvor du kunne høre nogen sige: Um dagens vejr. Spørgsmålet er, hvad er den rigtige transskription for det lydklip? Er det Um (komma) dagens vejr, eller er det Um (prik, prik, prik) dagens vejr, eller er Um noget, vi bare ikke transskriberer? Det viser sig, at enhver af disse er i orden, men det, der ikke er i orden, er, hvis forskellige transskribentere bruger hver af de tre mærkningskonventioner. Så er dine data støjende, og det skader talegenkendelsessystemet. Nu, når du har millioner eller en milliard brugere, kan du have de støjende data og bare gennemsnittet dem - indlæringsalgoritmen vil fungere fint. Men hvis du er i en indstilling, hvor du har et mindre datasæt – f.eks. hundrede eksempler – så har denne type støjende data en enorm indflydelse på ydeevnen.

Et andet eksempel fra fremstillingen: vi lavede meget arbejde med stålinspektion. Hvis du kører bil, var siden af ​​din bil engang lavet af en stålplade. Nogle gange er der små rynker i stålet, eller små buler eller pletter på det. Så du kan bruge et kamera og computersyn til at se, om der er fejl eller ej. Men forskellige etikettere vil mærke dataene forskelligt. Nogle vil sætte en kæmpe afgrænsningsboks rundt om hele regionen. Nogle vil sætte små afgrænsningskasser rundt om de små partikler. Når du har et beskedent datasæt, skal du sørge for, at de forskellige kvalitetsinspektører mærker dataene konsekvent - det viser sig at være en af ​​de vigtigste ting.



Til mange AI-projekter er open source-modellen, du downloader fra GitHub – det neurale netværk, som du kan få fra litteraturen – god nok. Ikke for alle problemer, men hovedproblemerne. Så jeg har gået til mange af mine hold og sagt: Hej alle sammen, det neurale netværk er godt nok. Lad os ikke rode med koden længere. Det eneste, du skal gøre nu, er at bygge processer for at forbedre kvaliteten af ​​dataene. Og det viser sig, at det ofte resulterer i hurtigere forbedringer af algoritmens ydeevne.

Hvad er datastørrelsen, du tænker på, når du siger mindre datasæt? Taler du om hundrede eksempler? Ti eksempler?

Maskinlæring er så forskelligartet, at det er blevet virkelig svært at give ensartede svar. Jeg har arbejdet på problemer, hvor jeg havde omkring 200 til 300 millioner billeder. Jeg har også arbejdet med problemer, hvor jeg havde 10 billeder, og alt derimellem. Når jeg ser på fremstillingsapplikationer, tror jeg, at noget som tiere eller måske hundrede billeder for en defektklasse ikke er usædvanligt, men der er meget stor variation selv inden for fabrikken.

Jeg oplever, at AI-praksis skifter, når træningssætstørrelserne går under, lad os sige, 10.000 eksempler, fordi det er en slags tærskel, hvor ingeniøren dybest set kan se på hvert eksempel og designe det selv og derefter træffe en beslutning.

For nylig chattede jeg med en meget dygtig ingeniør i en af ​​de store teknologivirksomheder. Og jeg spurgte: Hej, hvad gør du, hvis etiketterne er inkonsistente? Og han sagde: Nå, vi har dette hold på flere hundrede mennesker i udlandet, der laver mærkningen. Så jeg skriver mærkningsinstruktionerne, får tre personer til at mærke hvert billede, og så tager jeg et gennemsnit. Og jeg sagde: Ja, det er den rigtige ting at gøre, når du har et kæmpe datasæt. Men når jeg arbejder med et mindre team, og etiketterne er inkonsekvente, sporer jeg bare de to personer, der er uenige med hinanden, får dem begge til et Zoom-opkald og får dem til at tale med hinanden for at prøve at finde en løsning.

Jeg vil gerne henlede vores opmærksomhed nu for at tale om dine tanker om den generelle AI-industri. Algoritmen er vores AI-nyhedsbrev, og jeg gav vores læsere mulighed for at stille nogle spørgsmål til dig på forhånd. En læser spørger: AI-udvikling ser ud til for det meste at have splittet sig mod enten akademisk forskning eller storstilede, ressourcekrævende, store virksomhedsprogrammer som OpenAI og DeepMind. Det efterlader ikke rigtig meget plads til små startups at bidrage med. Hvad tror du er nogle praktiske problemer, som mindre virksomheder virkelig kan fokusere på for at hjælpe med at drive reel kommerciel indførelse af kunstig intelligens?

Jeg tror, ​​at meget af mediebevågenheden har en tendens til at være på de store virksomheder, og nogle gange på de store akademiske institutioner. Men hvis du går til akademiske konferencer, er der masser af arbejde udført af mindre forskningsgrupper og forskningslaboratorier. Og når jeg taler med forskellige mennesker i forskellige virksomheder og brancher, føler jeg, at der er så mange forretningsapplikationer, de kunne bruge AI til at tackle. Jeg plejer at gå til virksomhedsledere og spørge: Hvad er dine største forretningsproblemer? Hvad er de ting, der bekymrer dig mest? så jeg bedre kan forstå virksomhedens mål og derefter brainstorme, om der er en AI-løsning eller ej. Og nogle gange er der ikke, og det er fint.

Måske vil jeg lige nævne et par huller, som jeg synes er spændende. Jeg tror, ​​at det i dag stadig er meget manuel at bygge AI-systemer. Du har et par geniale maskinlærende ingeniører og dataforskere, der gør ting i en computer og derefter skubber tingene til produktion. Der er mange manuelle trin i processen. Så jeg er begejstret for ML ops [machine learning operations] som en ny disciplin, der hjælper med at gøre processen med at bygge og implementere AI-systemer mere systematisk.

Også, hvis du ser på mange af de typiske forretningsproblemer – alle funktionerne fra marketing til talent – ​​er der masser af plads til automatisering og effektivitetsforbedringer.

Jeg håber også, at AI-samfundet kan se på de største sociale problemer – se, hvad vi kan gøre for klimaændringer eller hjemløshed eller fattigdom. Ud over de til tider meget værdifulde forretningsproblemer bør vi også arbejde med de største sociale problemer.

Hvordan går du egentlig frem i processen med at identificere, om der er mulighed for at forfølge noget med maskinlæring for din virksomhed?

Jeg vil selv prøve at lære lidt om forretningen og forsøge at hjælpe virksomhedslederne med at lære lidt om AI. Så plejer vi at brainstorme et sæt projekter, og for hver af ideerne vil jeg lave både teknisk diligence og business diligence. Vi ser på: Har du nok data? Hvad er nøjagtigheden? Er der en lang hale, når du implementerer i produktionen? Hvordan fylder du data tilbage og lukker sløjfen for kontinuerlig læring? Så sørg for, at problemet er teknisk muligt. Og så business diligence: vi sørger for, at dette vil opnå det ROI, som vi håber på. Efter den proces har du det sædvanlige, som at estimere ressourcerne, milepæle og så forhåbentlig gå i gang.

Et andet forslag: det er vigtigere at starte hurtigt, og det er okay at starte i det små. Min første meningsfulde forretningsapplikation hos Google var talegenkendelse, ikke websøgning eller annoncering. Men ved at hjælpe Googles taleteam med at gøre talegenkendelse mere præcis, gav det Brain-teamet troværdighed og råd til at gå efter større og større partnerskaber. Så Google Maps var det andet store partnerskab, hvor vi brugte computervision – til at læse husnumre for at geolokalisere huse på Google maps. Og først efter de første to succesfulde projekter havde jeg en mere seriøs samtale med reklameteamet. Så jeg tror, ​​jeg ser flere virksomheder fejle ved at starte for stort, end fejle ved at starte for småt. Det er fint at lave et mindre projekt for at komme i gang som organisation for at lære, hvordan det føles at bruge AI, og derefter fortsætte med at bygge større succeser.

Hvad er én ting, som vores publikum bør begynde at gøre i morgen for at implementere AI i deres virksomheder?

Hop ind. AI forårsager et skift i dynamikken i mange industrier. Så hvis din virksomhed ikke allerede laver ret aggressive og smarte investeringer, er det et godt tidspunkt.

skjule