IBMs debatterende AI er lige kommet meget tættere på at være et nyttigt værktøj

IBM Debater-system i Cambridge

IBM Debater-system i Cambridge IBM Research





Computere har guidet os til månen og tilbage, men kan ikke hjælpe os med de største beslutninger, vi står over for i dag. Skal Donald Trump retsforfølges og fjernes fra embedet? Skal Storbritannien forlade EU? Skal Australien stoppe med at eksportere fossile brændstoffer? Spørgsmål som disse har ikke lette ja eller nej-svar, hvor fristende det end er at tro noget andet.

Vi træffer beslutninger ved at afveje fordele og ulemper. Kunstig intelligens har potentialet til at hjælpe os med det ved at gennemsøge stadigt større mængder af data. Men for at være virkelig nyttig, skal den ræsonnere mere som et menneske. Vi gør brug af overbevisende sprog og al mulig baggrundsviden, som er meget svær at modellere i AI, siger Jacky Visser fra Center for Argument Technology ved University of Dundee, UK. Dette har været en af ​​de hellige grale, siden folk begyndte at tænke på AI.

En kerneteknik, der bruges til at hjælpe maskiner med fornuft, kendt som argument mining, involverer at bygge software til at analysere skriftlige dokumenter og udtrække nøglesætninger, der giver bevis for eller imod en given påstand. Disse kan så samles til et argument. Ud over at hjælpe os med at træffe bedre beslutninger, kunne sådanne værktøjer bruges til at fange falske nyheder – underminere risikable påstande og sikkerhedskopiere faktuelle – eller til at filtrere online søgeresultater og returnere relevante udsagn i stedet for hele dokumenter.



Andre gruppers arbejde med argument mining har fokuseret på specifikke typer tekster, såsom juridiske dokumenter eller studerende essays, som har en tendens til at indeholde en masse strukturerede argumenter til at starte med. Det er nyttigt, hvis du for eksempel vil have et resumé af alle beviser på tværs af mange forskellige dokumenter i en retssag. Men det ultimative mål er at opbygge et system, der kan trawle gennem så mange informationskilder som muligt og opbygge et argument ved at bruge alle de beviser, det kan finde.

IBM har netop taget et stort skridt i den retning. Virksomhedens Project Debater-team har brugt flere år på at udvikle en AI, der kan bygge argumenter. Sidste år demonstrerede IBM sin work-in-progress teknologi i en live debat mod en verdensmester i menneskelig debattør, svarende til Watsons Fare! opgør. Sådanne stunts er sjove, og det gav et proof of concept. Nu gør IBM sit legetøj til et virkelig brugbart værktøj.

Den version af Project Debater, der blev brugt i live-debatterne, inkluderede kimen til det seneste system, såsom evnen til at søge i hundredvis af millioner af nye artikler. Men i månederne siden har holdet i vid udstrækning justeret de neurale netværk, det bruger, og forbedret kvaliteten af ​​de beviser, systemet kan afsløre. En vigtig tilføjelse er BERT , et neuralt netværk, som Google har bygget til behandling af naturligt sprog, som kan besvare forespørgsler. Værket vil blive præsenteret på konferencen Association for the Advancement of Artificial Intelligence i New York i næste måned.



For at træne deres AI trak ledende forsker Noam Slonim og hans kolleger hos IBM Research i Haifa, Israel, på 400 millioner dokumenter hentet fra LexisNexis database med avis- og tidsskriftsartikler. Dette gav dem omkring 10 milliarder sætninger, et naturligt sprogkorpus omkring 50 gange større end Wikipedia. De parrede denne enorme evidenspulje med påstande om flere hundrede forskellige emner, såsom bloddonation burde være obligatorisk, eller vi bør opgive Valentinsdag.

De bad derefter crowd workers på Figure Eight-platformen om at mærke sætninger efter, om de fremlagde bevis for eller imod bestemte påstande. De mærkede data blev ført til en overvåget indlæringsalgoritme.

Det resulterende neurale netværk kan håndtere forespørgsler om en lang række emner og returnere sætninger, der er mere relevante end dem, der er identificeret af tidligere systemer. Den rangerer sætningerne, den finder efter, hvor gode de er som bevis. For eksempel, givet påstanden om at bloddonation skulle være obligatorisk, fandt softwaren sætningen. En undersøgelse offentliggjort i American Journal of Epidemiology viste, at bloddonorer har 88 procent mindre risiko for at lide af et hjerteanfald og slagtilfælde.



En stor udfordring er at fortælle sætninger, der giver beviser fra dem, der ikke gør, selvom de indeholder de samme udtryk. Project Debater fandt for eksempel også denne sætning for bloddonationspåstanden, men kunne fortælle, at den hverken støttede eller underminerede den: Statistik fra Nakasero Blood Bank viser, at studerende er de vigtigste bloddonorer, der bidrager med omkring 80 pct. blodet indsamlet på verdensplan.

Præcis hvad det er ved disse sætninger, som det neurale netværk opfanger for at foretage sin klassificering, er ikke klart, siger Slonim. Alligevel, da de blev testet, opnåede Project Debater 95 % nøjagtighed for de 50 bedste sætninger på tværs af 100 forskellige emner, siger han og tilføjer: Disse tal er uhørte. Andre systemer har kun håndteret et par dusin emner. Det er også en stor forbedring i forhold til det livedebatsystem, Slonim viste frem sidste år.

Andre forskere, jeg talte med, inklusive Visser og Oana Cocarascu, som studerer argumentationssoftware og naturlig sprogbehandling på Imperial College London, var også imponerede over det nye system. For Cocarascu er det potentialet for applikationer fra den virkelige verden, der er mest spændende. Et system, der er trænet i juridiske dokumenter, vil ikke klare de mange forskellige typer beviser, der findes online. Slonims team har vist, at Project Debater kan håndtere denne brede vifte af kilder. Det er det, der gør det fantastisk, siger Cocarascu.



Holdet frigiver nu sine træningsdata, som andre kan arbejde med. Visser ønsker at bygge argument mining-værktøjer som Project Debater, der kan evaluere kvaliteten af ​​argumenter og se efter ting som kognitiv bias. Han og hans kolleger har brugt AI til at vurdere kvaliteten af ​​argumenter i de amerikanske præsidentdebatter i 2016, for eksempel.

IBM gør noget lignende selv. Via en tilføjelse, kaldet Speech by Crowd, kan Project Debater crowdsource argumenter for og imod et forslag og derefter automatisk vurdere kvaliteten af ​​indsendte argumenter ved hjælp af et neuralt netværk trænet på et datasæt på omkring 30.000 argumenter, der tidligere blev scoret for kvalitet af mennesker.

IBM planlægger at tilbyde Project Debater som en platform til virksomheder og regeringer. Vi ser fremtiden for Project Debater som en AI-skytjeneste, siger Christopher Sciacca, en talsmand for virksomheden. I en eksempelapplikation indsamlede IBM 3.500 meninger fra borgere i Lugano, Schweiz, om hvorvidt byen skulle investere i autonome køretøjer og brugte AI til at udtrække og vurdere argumenter for og imod forslaget. Den lokale regering kunne bruge resultaterne til at træffe en politisk beslutning.

Men for Slonim handler det om at forbedre vores interaktion med AI på et personligt niveau. Argumentation spiller en vigtig rolle i, hvordan mennesker kommunikerer: vi lister årsager til vores valg, vi spørger til råds, vi overtaler og lokker. At tale med virtuelle assistenter, der kunne tale på det niveau, ville føles langt mere naturligt. Det, vi laver, berører noget grundlæggende for vores liv, siger han. Vi forsøger at binde sprogforståelsesteknologier sammen for at hjælpe folk med at træffe bedre beslutninger.

skjule