211service.com
Machine learning forudsiger VM-vinder
Matthias Hangst | Getty
VM i fodbold 2018 starter i Rusland på torsdag og bliver sandsynligvis en af de mest sete sportsbegivenheder i historien, mere populær endda end OL. Så de potentielle vindere er af væsentlig interesse.
En måde at måle sandsynlige resultater på er at se på bookmakernes odds. Disse virksomheder bruger professionelle statistikere til at analysere omfattende databaser med resultater på en måde, der kvantificerer sandsynligheden for forskellige udfald af enhver mulig match. På den måde kan bookmakere tilbyde odds på alle de spil, der starter i løbet af de næste par uger, samt odds på potentielle vindere.
Et endnu bedre estimat kommer fra at kombinere odds fra mange forskellige bookmakere. Denne tilgang antyder, at Brasilien er den klare favorit til at vinde VM 2018 med en sandsynlighed på 16,6 procent, efterfulgt af Tyskland (12,8 procent) og Spanien (12,5 procent).
Men i de senere år har forskere udviklet maskinlæringsteknikker, der har potentialet til at udkonkurrere konventionelle statistiske tilgange. Hvad forudsiger disse nye teknikker som det sandsynlige udfald af verdensmesterskabet i 2018?
Et svar kommer fra Andreas Grolls arbejde ved det tekniske universitet i Dortmund i Tyskland og nogle få kolleger. Disse fyre bruger en kombination af maskinlæring og konventionel statistik, en metode kaldet en tilfældig skovtilgang, til at identificere en anden mest sandsynlig vinder.
Først lidt baggrund. Random-forest-teknikken er dukket op i de senere år som en kraftfuld måde at analysere store datasæt på, samtidig med at man undgår nogle af faldgruberne ved andre data-mining-metoder. Det er baseret på ideen om, at en fremtidig begivenhed kan bestemmes af et beslutningstræ, hvor et resultat beregnes ved hver gren ved henvisning til et sæt træningsdata.
Beslutningstræer lider dog af et velkendt problem. I de sidste stadier af forgreningsprocessen kan beslutninger blive alvorligt forvrænget af træningsdata, der er sparsomme og tilbøjelige til stor variation ved denne form for løsning, et problem kendt som overtilpasning.
Tilfældig skov-tilgangen er anderledes. I stedet for at beregne resultatet ved hver gren, beregner processen resultatet af tilfældige grene. Og det gør den mange gange, hver gang med et andet sæt tilfældigt udvalgte grene. Det endelige resultat er gennemsnittet af alle disse tilfældigt konstruerede beslutningstræer.
Denne tilgang har betydelige fordele. For det første lider den ikke af det samme overtilpasningsproblem, som plager almindelige beslutningstræer. Det afslører også, hvilke faktorer der er vigtigst for at bestemme resultatet.
Så hvis et bestemt beslutningstræ indeholder masser af parametre, bliver det nemt at se, hvilke der har størst indflydelse på resultatet, og hvilke der ikke gør. Disse mindre vigtige faktorer kan så ignoreres i fremtiden.
Groll og co bruger præcis denne tilgang til at modellere verdensmesterskabet i 2018. De modellerer resultatet af hvert spil, holdene sandsynligvis vil spille, og bruger resultaterne til at konstruere det mest sandsynlige forløb af turneringen.
Groll og co begynder med en lang række potentielle faktorer, der kan bestemme resultatet. Disse omfatter økonomiske faktorer såsom et lands BNP og befolkning, FIFA's rangering af landshold og holdenes egenskaber, såsom deres gennemsnitsalder, antallet af Champions League-spillere, de har, om de har hjemmefordel, og så videre .
Interessant nok tillader random-forest-tilgangen Groll og co at inkludere andre rankingforsøg, såsom ranking, der bruges af bookmakere.
At tilslutte alt dette til modellen giver nogle interessante indsigter. For eksempel viser de mest indflydelsesrige faktorer sig at være holdrangeringerne skabt af andre metoder, inklusive dem fra bookmakere, FIFA og andre.
Andre vigtige faktorer inkluderer BNP og antallet af Champions League-spillere på holdet. Uvigtige faktorer inkluderer landets befolkning, trænerens nationalitet og så videre.
De forudsigelser, der er opnået gennem denne proces, adskiller sig fra andre på nogle vigtige måder. Til at begynde med udvælger tilfældig skov-metoden Spanien som den mest sandsynlige vinder med en sandsynlighed på 17,8 procent.
En stor faktor i denne forudsigelse er strukturen af selve turneringen. Hvis Tyskland rydder gruppefasen af konkurrencen, er der større sandsynlighed for, at det møder stærk modstand i 16-holds knockout-fasen. På grund af dette beregner tilfældig skov-metoden Tysklands chancer for at nå kvartfinalen til 58 procent. Derimod er det usandsynligt, at Spanien møder stærk modstand i 16-finalerne og har derfor en chance på 73 procent for at nå kvartfinalerne.
Hvis begge kommer til kvartfinalerne, har de en nogenlunde lige chance for at vinde. Spanien er en smule begunstiget i forhold til Tyskland, primært på grund af det faktum, at Tyskland har en forholdsvis stor chance for at falde fra i ottendedelsfinalen, siger Groll og co.
Men der er et ekstra twist. Random-tree processen gør det muligt at simulere hele turneringen, og dette giver et andet resultat.
Groll og co simulerede hele turneringen 100.000 gange. Ifølge det mest sandsynlige turneringsforløb ville det tyske hold i stedet for det spanske vinde VM, siger de.
Selvfølgelig, på grund af det store antal permutationer af spil, er dette kursus stadig ekstremt usandsynligt. Groll og co sætter odds til omkring 1 ud af 100.000.
Så der har du det. I starten af turneringen har Spanien ifølge Groll og co de bedste vinderchancer. Men hvis Tyskland kommer til kvartfinalen, bliver det så frontløberen.
Turneringen starter på torsdag, hvor værterne, Rusland, tager imod Saudi-Arabien. Desværre ser ingen af disse hold ud til at nå kvartfinalerne.
Ref: arxiv.org/abs/1806.03208 : Forudsigelse af FIFA World Cup 2018 – En tilfældig skovtilgang med vægt på estimerede holdevneparametre