Google til udviklere: Sådan stopper du med at lave dumme chatbots

Generelt er computere ubrugelige til at føre en samtale. De tager bare tingene lidt for bogstaveligt. Men Google lærer computere, hvordan man kan forstå lunerne i menneskelig tale og tekst.





Fra i dag åbner Google disse algoritmer for eksterne softwareudviklere. De frigivne værktøjer vil hjælpe programmører med at bygge sprogbaserede apps og tjenester, der er mindre tilbøjelige til irriterende misforståelser end mange af nutidens chatbots. Og de burde hjælpe med at få udviklere til at blive tilsluttet de kraftfulde maskinlæringsteknikker, som Google finpudser.

Googles egen beherskelse af grammatik og syntaks hjælper virksomheden med at levere mere præcise søgeresultater, og det bliver stadig vigtigere, efterhånden som flere af dets enheder og tjenester kommer til at afhænge af stemmestyring.

Smartphones baseret på Googles software kan naturligvis allerede stemmestyres, og virksomheden menes i vid udstrækning at udvikle enheder til hjemmet i lighed med Amazons Echo, der er mere afhængige af stemmeinteraktion. Så det giver meget strategisk mening at frigive et værktøj, der gør sprogforståelse mere tilgængelig.



De fleste af vores brugere interagerer med os gennem sprog, siger Fernando Pereira, der leder virksomhedens indsats inden for naturlig sprogforståelse og maskinlæring. De stiller spørgsmål, skrevet eller talt. Og så for at vi kan tjene brugeren godt, er vi nødt til at få vores systemer til at forstå, hvad brugerne ønsker.

Et af de værktøjer, der udgives i dag, kaldet SyntaxNet, kan lære at forstå betydningen af ​​ord og sætninger givet deres kontekst og almindelige brug. Dette fungerer med den dybe læringsramme, som tidligere blev udgivet af Google, kaldet TensorFlow. Og det er den mest komplekse og sofistikerede komponent bygget ved hjælp af TensorFlow til dato.

Google har også udgivet en forudtrænet parser til engelsk, kaldet Parsey McParseface (en talsmand siger, at virksomheden havde problemer med at finde på et navn, da nogen foreslog denne iørefaldende betegnelse). Tekst indført i parseren vil automatisk blive opdelt i syntaktiske komponenter såsom navneord, verber, emner og objekter. Dette gør det nemmere for en computer at analysere tvetydige forespørgsler eller kommandoer korrekt.



Google er normalt afhængig af data og maskinlæring - og nogle andre tilgange, såsom Facebooks, forsøger faktisk at træne computere til at analysere sprog ved at tilføre dem store mængder stort set umærkede data (se Lære maskiner at forstå os). Men Googles sprogforståelsesprojekt, beskrevet i et papir online, er i stedet bygget op omkring menneskelig ekspertise. I mere end otte år har professionelle lingvister arbejdet med at kommentere tekst til virksomheden. Og de seneste fremskridt er blevet gjort ved at føre disse annotationer ind i et stort dybt-lærende neuralt netværk.

At forstå sprog er utroligt svært for computere, fordi sproget ofte er tvetydigt. En søgeforespørgsel så simpel som Find mig katte i hatte kan tolkes som en anmodning om enten katte iført hatte eller katte, der sidder i hatte. Mens mennesker bruger generel viden til at disambiguere sådanne sætninger, bruger Googles teknologi maskinlæring. Dets dybe indlæringssystem, trænet med syntaktisk tekst, afgør den mest sandsynlige korrekte struktur af et udsagn. I tilfælde af katte i hatte, antages det, at den søgende er interesseret i mode-forward kattedyr.

Dave Orr, produktchefen hos Google med ansvar for at finde kommercielle applikationer til virksomhedens forskning i sprogforståelse, demonstrerede teknologien for mig. Han fodrede flere artikler fra MIT Technology Review ind i en intern version af sprogparseren. Den lavede et par trivielle fejl – for eksempel ved at forveksle ordet vilje i starten af ​​en sætning med mit fornavn – men det så generelt ud til at kommentere sætninger med imponerende nøjagtighed og identificere syntaktiske strukturer, der korrekt fangede betydningen af ​​overskriften eller leadet. Det er den bedste parser, nogen har lavet, siger Orr. Vi synes, det er tæt på menneskeligt niveau.



Internt kombinerer Google sit naturlige sprogsystem med en database med semantisk information kaldet Knowledge Graph. Dette gør det muligt at genkende bestemte objekter, personer, steder og andre koncepter og reagere i overensstemmelse hermed. Systemet er også ofte i stand til at klassificere nye ord korrekt ved at sammenligne dem med andre ord, der optræder i en lignende sammenhæng. Indtil videre fungerer teknologien til 15 sprog. Nogle sprog er mere udfordrende at parse sprogligt, hvilket gør træningen sværere, siger Orr.

Teknologien er dog langt fra i stand til at forstå engelsk perfekt. Vores systemer fungerer bedst på velstruktureret, velredigeret tekst, siger Pereira. Uregelmæssigheden af ​​sociale medier og søgeforespørgsler er mere udfordrende. Vi har gjort fremskridt der, men der er meget frihøjde.

Der er også stadig mange uklarheder, der kræver et menneskeligt niveau af sund fornuft - ting, som vi lærer af erfaring og af instruktion fra vores jævnaldrende og vores forældre, siger Pereira. Den slags meget rig evne til at løse problemer er, hvor vores systemer er fuldstændig tabt.



Noah Goodman, en professor ved Stanford University, som forsker i sprogforståelse, siger, at forbedret syntaktisk forståelse kun er begyndelsen på, hvad computere har brug for for at mestre sprog. Syntaks er bestemt en vigtig del af sproget, siger han. Men det er et stort skridt fra det til semantik og fra overfladisk semantik til udledt betydning.

skjule