Wie unser Tennis-Modell funktioniert: Elo, Aufschlagstatistiken, Monte Carlo
Tennis gehört zu den saubersten Sportarten, um sie zu modellieren — ein Spieler gegen einen anderen, keine Mitspieler, die das Signal verwässern, jahrzehntelange Spieldaten frei verfügbar. Diese Einfachheit täuscht allerdings. Ein Modell dazu zu bringen, wirklich zusätzliche Information über das hinaus zu liefern, was ein scharfer Markt schon einpreist, ist schwer — und ein Modell dazu zu bringen, dort ehrlich zu sein, wo es das nicht kann, ist noch schwerer. Dieser Beitrag zeigt genau, wie unsere ATP- und WTA-Modelle aufgebaut sind, was sie füttert, und — an der Stelle, an der es am meisten zählt — wo wir uns bewusst entschieden haben, weniger zu wetten, statt mehr Wissen vorzutäuschen, als wir haben.
Zwei Touren, zwei Modelle
Wir trainieren separate Modelle für ATP und WTA. Herren- und Damentennis haben tatsächlich unterschiedliche Dynamiken — Aufschlagdominanz, Matchlänge, Ballwechselmuster — und ein einzelnes Modell für beide zu erzwingen, mittelt echtes Signal weg. Beide sind einzelne XGBoost-Klassifikatoren, trainiert auf den Sieger-Markt (h2h), mit ~23.000 ATP- und ~21.000 WTA-Matches von 2018–2026, basierend auf Jeff Sackmanns offenem historischen Datensatz.
Spar dir die Handrechnung.
Echte Value Bets für dich markiert — 7 Tage kostenlosDie resultierenden Brier-Scores — ein Standardmaß für probabilistische Genauigkeit, bei dem niedriger besser ist und 0,25 einem Münzwurf entspricht — liegen bei 0,1629 für ATP und 0,1547 für WTA. Beide liegen deutlich unter der Münzwurf-Basislinie, was der erste Plausibilitätscheck ist, den jedes Vorhersagemodell bestehen muss, bevor es sich lohnt, darauf aufzubauen.
Eine bewusste Design-Entscheidung: Die beiden Touren nutzen nicht einmal dieselbe Anzahl Features. ATP läuft mit 18 Features, WTA mit 28. Das ist kein Versehen — es ist das Ergebnis von Feature-Pruning pro Tour, validiert außerhalb der Trainingsdaten. Ein Feature, das das WTA-Modell schärft, kann bei ATP reines Rauschen sein — und umgekehrt. Das klarste Beispiel: WTA lässt die Gesamt-Elo komplett aus dem Feature-Set und stützt sich stattdessen auf belagspezifische Elo — eine Unterscheidung, die einen eigenen Abschnitt verdient.
Elo, und warum der Belag zählt
Falls dir die Mechanik nicht vertraut ist: Unser Beitrag Elo-Ratings erklärt deckt das allgemeine Konzept ab — ein sich selbst korrigierendes Bewertungssystem, das nach Siegen gegen starke Gegner steigt und nach Niederlagen gegen schwächere fällt. Tennis fügt eine Besonderheit hinzu, die wichtig zu wissen ist: Die Gesamt-Elo eines Spielers ist eine Mischung aus Ergebnissen auf Sand, Rasen und Hartplatz, aber diese Beläge spielen sich so unterschiedlich, dass eine einzige Zahl viel verbergen kann.
Deshalb berechnen wir neben der Gesamt-Elo eine belagspezifische Elo separat für Sand, Rasen und Hartplatz. Ein Sandplatz-Spezialist, der auf Rasen mittelmäßig ist, zeigt diesen Split klar in der Belags-Elo, auch wenn seine Gesamtzahl unauffällig wirkt. Weil viele Spieler auf einem Belag schlicht wenige Matches gespielt haben — Rasen bekommt besonders wenig Anteil am Kalender — wird die Belags-Elo bei dünner Stichprobe Richtung Gesamt-Elo geschrumpft. Das verhindert, dass die Rasen-Bewertung eines Spezialisten nach drei Matches wild überkonfident wird.
Genau deshalb kann das WTA-Modell die Gesamt-Elo fallen lassen und sich auf die Belags-Elo stützen: Sobald eine verlässliche belagspezifische Zahl vorliegt, bringt die gemischte Gesamtbewertung wenig zusätzlich — für WTA zeigte unsere Validierung, dass sie nichts als Rauschen hinzufügte.
Aufschlag, Return, Ermüdung: das Feature-Set
Neben Elo stützen sich die Modelle auf drei Signal-Familien:
- Aufschlag- und Return-Statistiken — Erstaufschlag-Gewinnquote und gewonnene Returnpunkte, beides erwiesene Prädiktoren für Matchergebnisse auf Profi-Niveau.
- Ermüdung und Formfenster — Tage seit dem letzten Match, Matches in den letzten 7 Tagen und aktuelle Siegquoten.
- Elo — Gesamt und belagspezifisch, wie oben beschrieben.
Eines davon verdient eine Hervorhebung, die die meisten Wettenden nicht erraten würden: Tage seit dem letzten Match ist eines der stärksten Einzelfeatures im gesamten Modell. Entfernst du es, verschlechtert sich der Brier-Score um 0,015 — eine große Bewegung für ein einzelnes Feature in einem Modell dieser Größe. Ermüdung, oder das Fehlen davon, bewegt Matchergebnisse auf der Tour tatsächlich.
Wir haben auch die direkte Bilanz (Head-to-Head) als Feature getestet — die klassische Intuition „Spieler A schlägt Spieler B immer“ — und wieder verworfen. In der Validierung außerhalb der Trainingsdaten brachte sie nichts, sobald Elo und Form bereits im Modell waren; die direkte Bilanz wiederholt meist nur relatives Können, das Elo schon erfasst, mit viel zusätzlichem Rauschen aus kleinen Stichproben.
Zeitgenaue Disziplin: nie in die Zukunft schauen
Jede Aufschlag- und Return-Statistik, die ins Modell fließt, wird strikt aus der Vorsaison berechnet — nie aus Statistiken, die das vorherzusagende Match oder ein späteres Match einschließen. Das klingt selbstverständlich, ist aber die häufigste Art, wie ein Sportmodell sich selbst still betrügt: Wenn Trainingsdaten einem Feature je erlauben, die Ganzsaison-Aggregatstatistik eines Matches zu „sehen“, das mitten in der Saison stattfand, lernt das Modell ein Muster, das bei einer echten, noch nicht gespielten Vorhersage schlicht nicht existiert. Aufschlagfähigkeit ist Jahr für Jahr stabil genug, dass die Nutzung der Vorsaison-Zahlen fast nichts kostet — während dieses Leck komplett eliminiert wird.
Dieselbe Disziplin gilt für Elo, weshalb sie aktuell bleiben muss. Unsere Elo-Ratings werden nächtlich aktualisiert. Das haben wir auf die harte Tour gelernt: Ein veralteter Elo-Wert — selbst nur wenige Wochen alt — kostet still mehrere Prozentpunkte Genauigkeit, selbst wenn jeder andere Teil des Modells exakt wie vorgesehen funktioniert. Ein Modell ist nur so scharf wie die Zahlen, die an dem Tag hineinfließen, an dem es eine Frage beantworten soll.
Monte-Carlo-Totals — und warum das Modell gelernt hat, Nein zu sagen
Der Sieger-Markt ist nicht der einzige Markt im Tennis. Gesamtspiele (Over/Under) werden anders bepreist — nicht durch den XGBoost-Klassifikator, sondern durch eine Monte-Carlo-Simulation: Wir simulieren das Match Spiel für Spiel anhand der geschätzten Aufschlaghalte-Wahrscheinlichkeiten beider Spieler, tausende Male, und lesen daraus die Verteilung der gespielten Gesamtspiele ab.
Hier kommt der ehrliche Teil. Als wir die Over/Under-Wahrscheinlichkeit des Simulators gegen tatsächlich abgerechnete Ergebnisse geprüft haben, waren die Zahlen nicht gut. Die Korrelation zwischen der vorhergesagten Wahrscheinlichkeit des Modells und dem tatsächlichen Ausgang war praktisch null (≈0,02) — das heißt, die Zuversicht des Simulators trug fast keine echte unterscheidende Information — und dazu kam eine systematische Verzerrung Richtung Over. Ein Modell, das gleichzeitig nicht unterscheidungsfähig und verzerrt ist, ist genau die Art von Sache, die in einer Demo gut aussieht und im Live-Betrieb Geld verliert.
Statt das mit einem Anzeige-Filter zu überdecken, haben wir die tatsächliche Ausgabe repariert. Wir haben eine Platt-Kalibrierung pro Tour auf die Totals-Wahrscheinlichkeit angewendet — eine statistische Standardtechnik, die die rohe Ausgabe eines Modells auf seine wahre, ehrliche Verlässlichkeit abbildet. Weil der Simulator kaum echte Unterscheidungskraft hatte, tut die Kalibrierung genau das, was eine ehrliche Kalibrierung tun sollte: Sie zieht die Wahrscheinlichkeit Richtung Basisrate zusammen. Der praktische Effekt ist, dass das Modell jetzt bei Totals-Wetten größtenteils abstinent bleibt, statt einen falschen Vorteil vorzutäuschen. Nur die Fälle, in denen der Preis eines weichen Buchmachers tatsächlich fehlbepreist ist gegenüber Pinnacles de-viggter Linie — lies Devigging erklärt dazu, wie wir diese faire Linie extrahieren —, klären unsere EV-Schwelle und werden als Wette angezeigt.
Sieger-Wetten waren davon nicht betroffen — dieser Markt wird durch den oben beschriebenen XGBoost-Klassifikator bepreist, den wir separat validiert haben und der gut unterscheidet. Diese Kalibrierungs-Episode betrifft konkret den Monte-Carlo-Totals-Simulator. Für die ausführlichere Geschichte, wie sich die Modelle entwickelt haben, siehe unser Tennis-Modell-v3-Upgrade.
Von der Wahrscheinlichkeit zur Wette
Eine Modell-Wahrscheinlichkeit allein ist keine Wette — sie wird erst zu einer, wenn sie mit einem Marktpreis verglichen wird. Wir verankern jede Tennis-Vorhersage an de-viggten Pinnacle-Quoten, dem schärfsten öffentlich zugänglichen Tennismarkt, und behandeln diese de-viggte Zahl als unsere beste verfügbare Schätzung der wahren Wahrscheinlichkeit. Unser eigenes Modell muss deutlich von diesem Anker abweichen — und ein weicher Buchmacher muss Quoten bieten, die besser sind als das, was der de-viggte Pinnacle-Preis rechtfertigt —, bevor überhaupt etwas markiert wird.
Ein ehrlicher Abdeckungs-Vorbehalt: The Odds API, unsere Quotenquelle, führt nur rund 36 benannte Turniere — Grand Slams, Masters-Events und eine Handvoll 500er-Turniere. Viele kleinere 250er-Events haben schlicht keine verfügbare Pinnacle-Linie, und unsere Regel dabei ist absolut: kein Pinnacle-Anker, keine Wette. Wir schätzen keine faire Linie allein aus dünneren Preisen weicher Buchmacher; fehlt die scharfe Referenz, lassen wir das Match komplett aus — egal wie zuversichtlich unser eigenes Modell sonst wirken mag.
Klärt ein echter Vorteil die Hürde, fordern wir mindestens 5 % Expected Value, kappen bei 18 % (darüber ist es fast immer ein Datenartefakt statt ein echter Vorteil) und begrenzen die Maximalquote auf 3,50 — Außenseiter-Preise sind der am wenigsten verlässlich kalibrierte Teil jedes Marktes. Zudem fahren wir bei WTA leicht engere Pinnacle-Verhältnis-Anker als bei ATP — eine Unterscheidung, die direkt aus der Validierung gegen unsere eigene abgerechnete Wetthistorie stammt, nicht aus einer theoretischen Annahme.
Die Einsatzgröße folgt fraktionellem Kelly mit 25 %, begrenzt auf 5 % der Bankroll pro Wette — ein bewusst konservativer Anteil des mathematisch „optimalen“ Kelly-Einsatzes, denn die Vorteilsschätzung eines Modells ist selbst unsicher, und volles Kelly bestraft diese Unsicherheit über eine lange Wetthistorie hart.
Woher wir wissen, dass es funktioniert — und wo nicht
Brier-Scores wie 0,1629 und 0,1547 sagen dir, dass das Modell einen Münzwurf schlägt, aber sie sagen dir nicht, ob es tatsächlich profitable Fehlbepreisungen gegen einen scharfen Markt findet. Dafür verfolgen wir den Closing Line Value (CLV) — hat sich der Preis, zu dem wir gewettet haben, bis zum Marktschluss verbessert oder verschlechtert? Lies Closing Line Value erklärt für die volle Mechanik. CLV ist die Metrik, der wir speziell bei Sieger-Wetten am meisten vertrauen, weil dieser Markt sich wie ein klassischer Moneyline-Markt verhält: eine ausreichend breite Preisspanne und ein effizienter Schluss machen CLV zu einem verlässlichen Langfrist-Signal. Bei Totals stützen wir uns mehr auf realisierten ROI und Kalibrierungs-Checks als auf CLV allein, weil sich Totals-Märkte an den Rändern anders verhalten.
Wir veröffentlichen jede abgerechnete Wette, gewonnen oder verloren, auf unserer Track-Record-Seite — einschließlich derjenigen, die nicht aufgegangen sind. Du kannst außerdem live Modell-Ausgaben und die heutige Abdeckung im Tennis-Hub durchsuchen und mehr über das Modell selbst auf unserer Modell-Seite lesen.
Nichts davon ist ein Gewinnversprechen. Varianz dominiert jede kleine Wettstichprobe, Tennismärkte können außerhalb der größten Events dünn sein, und selbst ein gut kalibriertes Modell wird Verluststrecken haben, die nichts darüber aussagen, ob der zugrunde liegende Vorteil real ist. Was wir versprechen können: Jede Zahl, die du siehst — die Modell-Wahrscheinlichkeit, der Pinnacle-Anker, der Expected Value — ist genau das, was sie behauptet zu sein, berechnet auf dieselbe ehrliche Weise, egal ob dabei eine Wette oder eine Abstinenz herauskommt.