Maskinlæring spår verdenscupvinner

Matthias Hangst | Getty





Fotball-VM 2018 starter i Russland på torsdag og vil sannsynligvis bli en av de mest populære sportsbegivenhetene i historien, mer populær til og med enn OL. Så de potensielle vinnerne er av betydelig interesse.

En måte å måle sannsynlige utfall på er å se på bookmakernes odds. Disse selskapene bruker profesjonelle statistikere til å analysere omfattende databaser med resultater på en måte som kvantifiserer sannsynligheten for ulike utfall av enhver mulig match. På denne måten kan bookmakere tilby odds på alle spillene som starter i løpet av de neste ukene, samt odds på potensielle vinnere.

Et enda bedre estimat kommer fra å kombinere oddsen fra mange forskjellige bookmakere. Denne tilnærmingen antyder at Brasil er den klare favoritten til å vinne verdensmesterskapet i 2018, med en sannsynlighet på 16,6 prosent, etterfulgt av Tyskland (12,8 prosent) og Spania (12,5 prosent).



Men de siste årene har forskere utviklet maskinlæringsteknikker som har potensial til å overgå konvensjonelle statistiske tilnærminger. Hva spår disse nye teknikkene som det sannsynlige resultatet av verdensmesterskapet i 2018?

Et svar kommer fra arbeidet til Andreas Groll ved det tekniske universitetet i Dortmund i Tyskland og noen få kolleger. Disse gutta bruker en kombinasjon av maskinlæring og konvensjonell statistikk, en metode som kalles en tilfeldig skogtilnærming, for å identifisere en annen mest sannsynlig vinner.

Først litt bakgrunn. Teknikken med tilfeldig skog har dukket opp de siste årene som en kraftig måte å analysere store datasett på, samtidig som man unngår noen av fallgruvene til andre datautvinningsmetoder. Den er basert på ideen om at en fremtidig hendelse kan bestemmes av et beslutningstre der et utfall beregnes ved hver gren ved referanse til et sett med treningsdata.



Beslutningstrær lider imidlertid av et velkjent problem. I de siste stadiene av forgreningsprosessen kan beslutninger bli alvorlig forvrengt av treningsdata som er sparsomme og utsatt for stor variasjon ved denne typen løsning, et problem kjent som overtilpasning.

Tilnærmingen til tilfeldig skog er annerledes. I stedet for å beregne utfallet ved hver gren, beregner prosessen utfallet av tilfeldige grener. Og det gjør det mange ganger, hver gang med et annet sett med tilfeldig valgte grener. Det endelige resultatet er gjennomsnittet av alle disse tilfeldig konstruerte beslutningstrærene.

Denne tilnærmingen har betydelige fordeler. For det første lider den ikke av det samme overtilpasningsproblemet som plager vanlige beslutningstrær. Den avslører også hvilke faktorer som er viktigst for å bestemme utfallet.



Så hvis et bestemt beslutningstre inneholder mange parametere, blir det lett å se hvilke som har størst innvirkning på resultatet og hvilke som ikke gjør det. Disse mindre viktige faktorene kan så ignoreres i fremtiden.

Groll og co bruker akkurat denne tilnærmingen for å modellere verdensmesterskapet i 2018. De modellerer utfallet av hvert spill lagene sannsynligvis vil spille og bruker resultatene til å konstruere det mest sannsynlige løpet av turneringen.

Groll og co begynner med et bredt spekter av potensielle faktorer som kan bestemme utfallet. Disse inkluderer økonomiske faktorer som et lands BNP og befolkning, FIFAs rangering av landslag, og egenskapene til lagene selv, som gjennomsnittsalder, antall Champions League-spillere de har, om de har hjemmefordel, og så videre .



Interessant nok lar tilnærmingen med tilfeldig skog Groll og co inkludere andre rangeringsforsøk, for eksempel rangeringene som brukes av bookmakere.

Å plugge alt dette inn i modellen gir noen interessante innsikter. For eksempel viser det seg at de mest innflytelsesrike faktorene er lagrangeringene laget av andre metoder, inkludert de fra bookmakere, FIFA og andre.

Andre viktige faktorer inkluderer BNP og antall Champions League-spillere på laget. Uviktige faktorer inkluderer landets befolkning, nasjonaliteten til treneren og så videre.

Forutsigelsene som ble oppnådd gjennom denne prosessen skiller seg fra andre på noen viktige måter. Til å begynne med plukker tilfeldig skog-metoden ut Spania som den mest sannsynlige vinneren, med en sannsynlighet på 17,8 prosent.

En stor faktor i denne spådommen er imidlertid strukturen til selve turneringen. Hvis Tyskland klarerer gruppefasen av konkurransen, er det mer sannsynlig at det møter sterk motstand i 16-lags knockout-fasen. På grunn av dette beregner tilfeldig skog-metoden Tysklands sjanser for å nå kvartfinalen til 58 prosent. Derimot vil Spania neppe møte sterk motstand i 16-finalene, og har derfor en sjanse på 73 prosent til å nå kvartfinalen.

Hvis begge kommer til kvartfinale, har de en mer eller mindre lik sjanse til å vinne. Spania er litt favorisert fremfor Tyskland, hovedsakelig på grunn av at Tyskland har en relativt stor sjanse for å falle fra i sekstenrunden, sier Groll og co.

Men det er en ekstra vri. Tilfeldig-tre-prosessen gjør det mulig å simulere hele turneringen, og dette gir et annet resultat.

Groll og co simulerte hele turneringen 100 000 ganger. I følge den mest sannsynlige turneringsbanen ville det tyske laget vinne verdenscupen i stedet for det spanske, sier de.

Selvfølgelig, på grunn av det enorme antallet permutasjoner av spill, er dette kurset fortsatt ekstremt usannsynlig. Groll og co setter oddsen til omtrent 1 av 100 000.

Så der har du det. I starten av turneringen har Spania de beste vinnersjansene, ifølge Groll og co. Men hvis Tyskland kommer til kvartfinale, blir det fremste.

Turneringen starter torsdag, når vertene, Russland, møter Saudi-Arabia. Dessverre ser ingen av disse lagene ut til å klare å nå kvartfinalene.

Ref: arxiv.org/abs/1806.03208 : Prediction of the FIFA World Cup 2018 – En tilfeldig skogtilnærming med vekt på estimerte lagevneparametere

gjemme seg