Hvordan Reuters revolutionære AI-system samler globale nyheder

Internettets fremkomst og den efterfølgende informationseksplosion har gjort det stadig mere udfordrende for journalister at producere nyheder præcist og hurtigt. Så begynder forsknings- og udviklingsteamet hos det globale nyhedsbureau Reuters i et papir på arXiv i denne uge.





For Reuters er problemet blevet mere akut af fremkomsten af ​​falske nyheder som en vigtig faktor i at fordreje opfattelsen af ​​begivenheder.

Ikke desto mindre er nyhedsbureauer som Associated Press gået videre med automatiserede nyhedsskrivningstjenester. Disse rapporterer standardmeddelelser såsom finansielle nyheder og visse sportsresultater ved at indsætte dataene i forudskrevne skabeloner: X rapporterede et overskud på Y millioner i Q3, i resultater, der slog Wall Streets prognoser ...

Så der er et betydeligt pres på andre nyhedsbureauer for at automatisere nyhedsproduktionen. Og i dag skitserer Reuters, hvordan det næsten fuldstændigt har automatiseret identifikation af breaking news-historier. Xiaomo Liu og venner hos Reuters Research and Development og Alibaba siger, at det nye system fungerer godt. Det har faktisk potentialet til at revolutionere nyhedsbranchen. Men det rejser også bekymringer om, hvordan et sådant system kunne spilles af ondsindede aktører.



Det nye system hedder Reuters Tracer. Den bruger Twitter som en slags global sensor, der registrerer nyhedsbegivenheder, mens de sker. Systemet bruger derefter forskellige former for datamining og maskinlæring til at udvælge de mest relevante begivenheder, bestemme deres emne, rangordne deres prioritet og skrive en overskrift og et resumé. Nyhederne bliver derefter distribueret rundt om virksomhedens globale nyhedsledning.

Det første trin i processen er at suge Twitter-datastrømmen. Tracer undersøger omkring 12 millioner tweets om dagen, 2 procent af det samlede antal. Halvdelen af ​​disse udtages tilfældigt; den anden halvdel kommer fra en liste over Twitter-konti kurateret af Reuters menneskelige journalister. De omfatter beretninger fra andre nyhedsorganisationer, betydelige virksomheder, indflydelsesrige personer og så videre.

Næste trin er at bestemme, hvornår en nyhedshændelse har fundet sted. Tracer gør dette ved at antage, at en begivenhed er indtruffet, hvis flere personer begynder at tale om den på én gang. Så den bruger en klyngealgoritme til at finde disse samtaler.



Disse klynger inkluderer naturligvis spam, annoncer, almindelig chat og så videre. Kun nogle af dem henviser til nyhedsværdige begivenheder.

Så næste fase er at klassificere og prioritere begivenhederne. Tracer bruger en række algoritmer til at gøre dette. Den første identificerer emnet for samtalen. Det sammenligner derefter dette med en database med emner, som Reuters-teamet har indsamlet fra tweets produceret af 31 officielle nyhedskonti, såsom @CNN, @BBCBreaking og @nytimes samt nyhedsaggregatorer som @BreakingNews.

På dette stadium bestemmer algoritmen også placeringen af ​​begivenheden ved hjælp af en database med byer og lokationsbaserede søgeord.



Når en samtale eller et rygte potentielt er identificeret som nyheder, er en vigtig overvejelse dens sandhed. For at bestemme dette leder Tracer efter kilden ved at identificere det tidligste tweet i samtalen, der nævner emnet og eventuelle websteder, det peger på. Den konsulterer derefter en database med kendte producenter af falske nyheder, såsom National Report, eller satiriske nyhedssider såsom The Onion.

Til sidst skriver systemet en overskrift og et resumé og distribuerer nyhederne i hele Reuters-organisationen.

Under forsøg, siger Reuters-teamet, har systemet fungeret godt. Tracer er i stand til at opnå konkurrencedygtig præcision, tilbagekaldelse, aktualitet og sandhed på nyhedsdetektion og levering, siger de.



Og de har statistik til at understøtte dette. Systemet behandler 12 millioner tweets hver dag og afviser næsten 80 procent af dem som støj. Resten falder i omkring 6.000 klynger, som systemet kategoriserer som forskellige typer nyhedsbegivenheder. Det hele gøres af 13 servere, der kører 10 forskellige algoritmer.

Til sammenligning beskæftiger Reuters omkring 2.500 journalister rundt om i verden, som tilsammen genererer omkring 3.000 nyhedsalarmer hver dag ved hjælp af en række forskellige kilder, herunder Twitter. Heraf er omkring 250 skrevet op som nyhedshistorier.

Reuters sammenlignede de historier, som Tracer identificerer, med dem, der vises i nyhedsfeeds fra organisationer som BBC og CNN. Resultaterne indikerer, at Tracer kan dække omkring 70 procent af nyhedshistorierne med 2 procent af Twitter-data, siger Lui og co.

Og systemet fungerer bestemt hurtigt. Holdet fremhæver eksemplet med skyderiet i Las Vegas i oktober 2017, som efterlod 58 mennesker døde. Et vidne rapporterede hændelsen klokken 01:22, som udløste en Tracer-klynge. Klyngen opfyldte dog ikke systemets kriterier for, at en begivenhed blev inkluderet i nyhedsstrømmen før klokken 01.39. Reuters rapporterede hændelsen klokken 01.49, siger Lui og co.

Det er interessant arbejde, der rejser en række spørgsmål, især om hvor let systemet er at manipulere. Det er ikke svært at forestille sig ondsindede aktører, der designer Twitter-feeds med den specifikke hensigt at narre Tracer.

Men om dette system vil være lettere at spille end det nuværende, hvor mennesker jævnligt narres, er svært at sige.

Så er der menneskets rolle i nyhedsbranchen. Fremtiden for nyheder er helt klart en af ​​stigende automatisering. Hvordan mennesker passer ind er endnu ikke fastlagt.

Ref: arxiv.org/abs/1711.04068 : Reuters Tracer: Mod automatiseret nyhedsproduktion ved hjælp af store sociale mediedata

skjule