Baidus supercomputer med kunstig intelligens slår Google ved billedgenkendelse

Opdatering: Den 1. juni 2015 ændrede Baidu sin teknisk papir på sit system for at indrømme, at det havde brudt reglerne for ImageNet Challenge, som virksomheden havde brugt til at hævde, at det havde slået andre forskerhold. Arrangørerne af udfordringen gennemgik Baidus adfærd og udsendte en erklæring siger, at dets resultater ikke bør betragtes som direkte sammenlignelige med resultater opnået af andre.





Det kinesiske søgefirma Baidu byggede denne computer for at fremskynde sin forskning i kunstig intelligens.

Den kinesiske søgegigant Baidu siger, at den har opfundet en kraftfuld supercomputer, der bringer nye muskler til en kunstig intelligens-teknik, der giver software mere kraft til at forstå tale, billeder og skriftsprog.

Den nye computer, kaldet Minwa og placeret i Beijing, har 72 kraftige processorer og 144 grafikprocessorer, kendt som GPU'er. Sen mandag løslod Baidu et papir hævdede, at computeren var blevet brugt til at træne maskinlæringssoftware, der satte en ny rekord for genkendelse af billeder, og slog et tidligere mærke sat af Google.



Vores virksomhed leder nu kapløbet inden for computerintelligens, sagde Ren Wu, en Baidu-videnskabsmand, der arbejder på projektet, talte ved Embedded Vision Summit på tirsdag. Minwas beregningskraft ville sandsynligvis placere den blandt de 300 mest kraftfulde computere i verden, hvis den ikke var specialiseret til dyb læring, sagde Wu. Jeg tror, ​​at dette er den hurtigste supercomputer dedikeret til dyb læring, sagde han. Vi har stor magt i vores hænder - meget større end vores konkurrenter.

Computerkraft betyder noget i verden af ​​deep learning, som har skabt gennembrud inden for tale-, billed- og ansigtsgenkendelse og forbedret billedsøgnings- og talegenkendelsestjenesterne, der tilbydes af Google og Baidu.

Teknikken er en opsuget version af en tilgang, der først blev etableret for årtier siden, hvor data behandles af et netværk af kunstige neuroner, der administrerer information på måder, der er løst inspireret af biologiske hjerner. Dyb læring involverer at bruge større neurale netværk end før, arrangeret i hierarkiske lag, og at træne dem med væsentligt større samlinger af data, såsom fotos, tekstdokumenter eller optaget tale.



Indtil videre ser større datasæt og netværk ud til altid at være bedre for denne teknologi, sagde Wu. Det er en måde, det adskiller sig fra tidligere maskinlæringsteknikker, som var begyndt at producere faldende afkast med større datasæt. Når du først har skaleret dine data ud over et bestemt punkt, kunne du ikke se nogen forbedring, sagde Wu. Med dyb læring bliver det bare ved med at stige. Baidu siger, at Minwa gør det praktisk at skabe et kunstigt neuralt netværk med hundredvis af milliarder af forbindelser - hundredvis af gange mere end noget netværk bygget før.

Et blad udgivet mandag er beregnet til at give en forsmag på, hvad Minwas ekstra oomph kan gøre. Den beskriver, hvordan supercomputeren blev brugt til at træne et neuralt netværk, der satte en ny rekord på et standardbenchmark for billedgenkendelsessoftware. ImageNet Classification Challenge, som det kaldes, går ud på at træne software på en samling af 1,5 millioner mærkede billeder i 1.000 forskellige kategorier og derefter bede softwaren om at bruge det, den har lært, til at mærke 100.000 billeder, den ikke har set før.

Software sammenlignes på grundlag af, hvor ofte dets fem bedste gæt for et givet billede går glip af det rigtige svar. Systemet trænet på Baidus nye computer var kun forkert 4,58 procent af tiden. Den tidligere bedste var 4,82 procent, rapporteret af Google i marts. En måned før det, Microsoft havde anmeldt opnåede 4,94 procent, og blev den første til bedre gennemsnitlig menneskelig præstation på 5,1 procent.



Wu sagde, at Minwa havde gjort det muligt at træne systemet på billeder i højere opløsning. Det tillod også brug af en teknik, der forvandlede de originale 1,2 millioner træningsbilleder til to milliarder ved at forvrænge dem, vende dem og ændre deres farver. Brug af det større træningssæt forbedrede nøjagtigheden ved at forhindre systemet i at blive for fikseret på de nøjagtige detaljer i træningsbillederne, sagde Wu. Det resulterende system burde være bedre til at håndtere billeder fra den virkelige verden, sagde han.

Som disse slanke sejrsmargener på ImageNet-udfordringen måske antyder, er deep learning nu klar til sværere udfordringer end billedgenkendelse, såsom fortolkning af video eller beskrivelse af billeder i sætninger (se Googles hjerne-inspirerede software beskriver hvad det ser i komplekse billeder). Wu sagde, at såvel som at tænke på, hvordan man kan gøre Minwa endnu større og bruge det på video og tekst, arbejder Baidus forskere på måder at formindske deres trænede neurale netværk, så de kan fungere på mobile enheder.

Han viste en video af en prototype-smartphone-app, der kan genkende forskellige hunderacer, ved hjælp af en komprimeret version af et deep-learning-netværk trænet på en forgænger til Minwa. Hvis du ved, hvordan du udnytter beregningskraften af ​​en telefons GPU'er, kan du faktisk genkende direkte fra billedsensoren, sagde han.



skjule