Facebook hævder, at dens nye chatbot slår Googles som den bedste i verden





På trods af alle de fremskridt, som chatbots og virtuelle assistenter har gjort, er de stadig forfærdelige samtalepartnere. De fleste er meget opgaveorienterede: du stiller et krav, og de overholder dem. Nogle er meget frustrerende: de ser aldrig ud til at få det, du leder efter. Andre er frygtelig kedelige: de mangler charmen som en menneskelig ledsager. Det er fint, når du kun ønsker at indstille en timer. Men efterhånden som disse bots bliver mere og mere populære som grænseflader for alt fra detailhandel til sundhedspleje til finansielle tjenester, bliver utilstrækkelighederne kun mere tydelige.

Nu har Facebook åbnet en ny chatbot at den hævder kan tale om næsten alt på en engagerende og interessant måde. Blender kunne ikke kun hjælpe virtuelle assistenter med at løse mange af deres mangler, men også markere fremskridt hen imod den større ambition, der driver meget af AI-forskningen: at replikere intelligens. Dialog er en slags 'AI komplet'-problem, siger Stephen Roller, en forskningsingeniør hos Facebook, som var med til at lede projektet. Du skal løse hele AI for at løse dialog, og hvis du løser dialog, har du løst hele AI.

Blenders evner kommer fra det enorme omfang af dets træningsdata. Det blev først trænet på 1,5 milliarder offentligt tilgængelige Reddit-samtaler for at give det et grundlag for at generere svar i en dialog. Det blev derefter finjusteret med yderligere datasæt for hver af tre færdigheder: samtaler, der indeholdt en form for følelser , for at lære det empati (hvis en bruger siger, at jeg f.eks. har fået en forfremmelse, kan den sige, Tillykke!); informationstætte samtaler med en ekspert for at lære den viden; og samtaler mellem mennesker med forskellige personligheder , for at lære den personlighed. Den resulterende model er 3,6 gange større end Googles chatbot Meena , som blev annonceret i januar – så stor, at den ikke kan passe på en enkelt enhed og i stedet skal køre på tværs af to computerchips.



Facebook Blender chatlog

Et eksempel på en samtale mellem et menneske og Blender.

FACEBOOK

På det tidspunkt proklamerede Google, at Meena var den bedste chatbot i verden. I Facebooks egne tests fandt 75 % af de menneskelige evaluatorer imidlertid, at Blender var mere engagerende end Meena, og 67 % fandt, at det lyder mere som et menneske. Chatbot'en ​​narre også menneskelige evaluatorer 49% af tiden til at tro, at dens samtalelogfiler var mere menneskelige end samtaleloggene mellem rigtige mennesker - hvilket betyder, at der ikke var meget af en kvalitativ forskel mellem de to. Google havde ikke svaret på en anmodning om kommentar, da denne historie skulle offentliggøres.

På trods af disse imponerende resultater er Blenders færdigheder dog stadig ikke i nærheden af ​​et menneskes. Indtil videre har holdet kun evalueret chatbot'en ​​på korte samtaler med 14 ture. Hvis det blev ved med at chatte længere, formoder forskerne, ville det snart holde op med at give mening. Disse modeller er ikke i stand til at gå super i dybden, siger Emily Dinan, den anden projektleder. De er ikke i stand til at huske samtalehistorien ud over et par omgange.



Blender har også en tendens til at hallucinere viden eller finde på fakta - en direkte begrænsning af de dybe læringsteknikker, der bruges til at opbygge den. Det genererer i sidste ende sine sætninger ud fra statistiske korrelationer snarere end en database med viden. Som et resultat kan det sammensætte en detaljeret og sammenhængende beskrivelse af en berømt berømthed, for eksempel, men med fuldstændig falsk information. Holdet planlægger at eksperimentere med at integrere en vidensdatabase i chatbottens svargenerering.

Facebook Blender evaluering

Menneskelige evaluatorer sammenlignede multi-turn-samtaler med forskellige chatbots.

FACEBOOK

En anden stor udfordring med ethvert åbent chatbot-system er at forhindre det i at sige giftige eller partiske ting. Fordi sådanne systemer i sidste ende bliver trænet på sociale medier, kan de ende med at genoplive internettets vitriol. (Dette skete berygtet Microsofts chatbot Tay i 2016.) Holdet forsøgte at løse dette problem ved at bede crowdworkers om at bortfiltrere skadeligt sprog fra de tre datasæt, som det brugte til finjustering, men det gjorde ikke det samme for Reddit-datasættet på grund af dets størrelse. (Enhver, der har brugt meget tid på Reddit, ved, hvorfor det kunne være problematisk.)



Holdet håber at eksperimentere med bedre sikkerhedsmekanismer, herunder en giftig sprogklassificering, der kunne dobbelttjekke chatbotens svar. Forskerne indrømmer dog, at denne tilgang ikke vil være omfattende. Nogle gange kan en sætning som Ja, det er fantastisk virke fint, men i en følsom kontekst, såsom som svar på en racistisk kommentar, kan den få skadelige betydninger.

På lang sigt er Facebook AI-teamet også interesseret i at udvikle mere sofistikerede samtaleagenter, der kan reagere på visuelle signaler såvel som kun ord. Et projekt er at udvikle et system kaldet Image Chat, for eksempel, der kan kommunikere fornuftigt og personligt om de billeder, en bruger måtte sende.

skjule