WK 2026 voorspellen met data en predictive analytics
Net zoals eerdere jaren hebben we ons ook dit jaar weer gewaagd aan een voorspelling met betrekking tot het WK voetbal 2026. We gebruiken analyticstool Alteryx om dit vraagstuk te beantwoorden. Benieuwd hoe onze voorspelling tot stand is gekomen of op zoek naar inspiratie voor jouw WK-poule? Lees dan vooral verder.
Wouter
Senior Data Consultant & Trainer
Onze aanpak: van vraagstuk naar model
Wat hebben we nodig om met dit vraagstuk aan de slag te gaan? Het meest voor de hand liggende antwoord is natuurlijk data. Op Kaggle hebben we de laatste versie van de dataset “International football results from 1872 to 2026” gedownload. Deze dataset bevat alle voetbaluitslagen tussen landenteams in die periode.
Naast data hebben we een tool nodig waarmee we predictive analyses kunnen uitvoeren. Met Alteryx hebben we een tool in huis die hier uitermate geschikt voor is.
Van ruwe data naar een voorspellend model
Allereerst schonen we de data op en maken we deze gereed voor analyse.
Voordat we in Alteryx aan de slag gaan, stellen we onszelf de vraag: “Hoe moet de data eruitzien?” Om die vraag te beantwoorden, moeten we weten wat we uiteindelijk willen doen met de verzamelde data. We willen de volgende vraag beantwoorden:
“Kan het model voorspellen welk land wint wanneer we de wedstrijden van het WK door het model halen?”
Dit type voorspelling is binair: een land wint of verliest. Een gelijkspel laten we voor deze analyse buiten beschouwing, omdat dit alleen in de poulefase voorkomt.
Om dit mogelijk te maken, kijken we naar voorspellende kenmerken per regel in de dataset. De data ziet er als volgt uit:
De hoeveelheid voorspellende kenmerken in deze dataset is relatief beperkt. Daarom verrijken we de data met de ranking van deelnemende landen uit de dataset “FIFA World Ranking 1992-2026”.
Een wedstrijd wordt gespeeld op een specifieke datum, terwijl rankings op maand- en jaarniveau beschikbaar zijn. Op dat niveau koppelen we de datasets in Alteryx aan elkaar. Hierdoor wordt de data verrijkt met extra kolommen:
Per wedstrijd nemen we nu meer kenmerken mee in het voorspellende model.
Omdat we geen rankings hebben voor wedstrijden vóór 1992, beperken we de analyse tot de periode 1992 tot en met 2026.
Modelselectie en validatie
Alteryx biedt verschillende predictive tools. Omdat we een binair model nodig hebben, testen we een selectie van geschikte modellen. Die hebben we rood omkaderd in onderstaande afbeelding:
Met de “Create Samples” tool splitsen we de dataset in drie delen:
Estimation sample data (34%)
Validation sample data (33%)
Holdout data (33%)
Met de estimation sample trainen we de modellen. Dat betekent dat het model leert om op basis van kenmerken te voorspellen of een land een wedstrijd wint of verliest.
Vervolgens gebruiken we de “Score” tool om de modellen te testen op de validation sample:
De modellen proberen hier de winnaar van reeds gespeelde wedstrijden te voorspellen. Omdat de uitslagen al bekend zijn, kunnen we goed beoordelen welk model het meest accuraat is. Op basis daarvan kiezen we het beste model.
In dit geval voorspelt de Logistic Regression tool 66% van de wedstrijden correct:
Van model naar toernooivoorspelling
Vervolgens halen we alle gespeelde wedstrijden van 1992 tot en met 2026 van de deelnemende landen door het Logistic Regression-model. De uitkomsten gebruiken we om de wedstrijden in de poulefase van het WK te scoren. Per wedstrijd berekenen we de meest waarschijnlijke winnaar.
Voor elke gewonnen wedstrijd kennen we punten toe. Dit resulteert in een voorspelling van de eindstanden per groep. Op basis daarvan bepalen we welke landen doorgaan naar de knock-outfase.
Dit jaar is er een extra ronde toegevoegd: de “Laatste 32”. Daarnaast is er, net als bij het EK, een aparte ranglijst voor de beste nummers drie. Omdat ons model uitgaat van winnaars en verliezers per wedstrijd en geen exacte uitslagen voorspelt, kiezen we ervoor om de beste nummers drie te selecteren op basis van FIFA-ranking.
Wanneer we de wedstrijden in de Laatste 32 door het model halen, levert dat de volgende winnaars op:
Wat deze voorspelling zegt (en wat niet)
Het blijft een voorspelling. Alteryx berekent de meest waarschijnlijke winnaar per wedstrijd op basis van historische resultaten en rankings. Maar zoals in het voetbal vaak wordt gezegd: de bal is rond. Verrassingen blijven altijd mogelijk.
We zijn dan ook benieuwd hoe dicht deze voorspelling uiteindelijk bij het daadwerkelijke toernooiverloop komt.
Aannames en beperkingen van het model
Dit is de aanpak die wij hebben gekozen. Er zijn veel mogelijkheden om extra variabelen toe te voegen en het model verder te verfijnen. Het doel van deze blog is om te inspireren en te laten zien hoe je op een toegankelijke manier aan de slag kunt met predictive analytics.
Benieuwd hoe je predictive analytics kunt toepassen binnen je eigen organisatie? Neem gerust contact met ons op.
Interview: beluister het audiofragment
TwenteFM interviewde Wouter over de totstandkoming van onze voorspelling.
Beluister het interview hier.
Wouter
Senior Data Consultant & Trainer