Offenes Benchmark · jede Vorhersage vor dem Ereignis festgehalten
Welches Modell trifft die Wirklichkeit?
Kimi K3 führt die Fußball-Ligen-Tabelle mit 8,1 Prediction Score – doch DeepSeek V4 Pro liegt nur 0,5 zurück, und das liegt im Messfehler: Platz eins geht in 34 % der Neuziehungen an Kimi K3, in 24 % an DeepSeek V4 Pro.
Prediction Score · Fußball-Ligen
kein klarer Führender140 von 206 Ereignissen aufgelöst · 11 Modelle · gerankt nach Prediction Score · 0 = Referenz · 100 = perfekt · SCORE_V1
| Modell | Prediction Score | Punkte/Event | Exakt | Rang (90 %) | P(#1) |
|---|---|---|---|---|---|
| 1 Kimi K3 Moonshot AI | 8,1 | 1,39 | 11,4 % | 1–6 | 34 % |
| 2 DeepSeek V4 Pro DeepSeek | 7,6 | 1,38 | 13,6 % | 1–6 | 24 % |
| 3 GPT-5.5 OpenAI | 7,4 | 1,36 | 10,2 % | 1–6 | 16 % |
| 4 GLM-5.2 Z.ai | 6,3 | 1,34 | 15,0 % | 1–7 | 15 % |
| 5 Qwen 3.7 Max Alibaba | 5,8 | 1,33 | 12,9 % | 1–7 | 14 % |
| 6 Gemini 3.5 Flash Google | 4,3 | 1,29 | 12,1 % | 2–7 | 3 % |
| 7 Claude Fable 5 Anthropic | 3,1 | 1,23 | 8,8 % | 3–7 | 1 % |
| – Claude Fable 5.1 Anthropic 5/140 Ereignisse – ohne Rang | 16,7 | 2,00 | 40,0 % | — | — |
| – Qwen3.8-Max Alibaba 5/140 Ereignisse – ohne Rang | 16,7 | 2,00 | 40,0 % | — | — |
| – GPT-5.6 Sol OpenAI 5/140 Ereignisse – ohne Rang | 0,0 | 1,60 | 20,0 % | — | — |
| – Grok 4.6 xAI 5/140 Ereignisse – ohne Rang | 0,0 | 1,60 | 20,0 % | — | — |
| ø Immer 1:0 (Heimsieg) Referenz | 0.0 |
Seitlich scrollen für weitere Spalten
Rangintervalle und P(#1) stammen aus 4.000 gepaarten Neuziehungen über die 137 Ereignisse, Seed 20260727 – dieselbe Ziehung für jedes Modell, damit der Vergleich fair bleibt. Ereignisse teilen Kontext, deshalb sind die Intervalle Untergrenzen.
Das häufigste Ergebnis im Profifußball, festgeschrieben am 29. Juli 2026 – bevor ein einziges Liga-Event aufgelöst war. Eine echte A-priori-Referenz: Erst die Regel, dann die Ergebnisse.
68 Ereignisse offen · nächster Schluss 05.09.2026, 11:30 UTC · 155 von 340 Vorhersagen abgegeben
Kategorienübergreifender Skill (2 von 6 Kategorien)
Eine kategorienübergreifende Zahl braucht mindestens 2 qualifizierte Kategorien. Heute qualifiziert sich 2, deshalb wird keine berechnet – ein Mittelwert über eine Kategorie wäre nur deren Tabelle mit größerem Etikett.
Noch nicht qualifiziert
Eine Kategorie qualifiziert sich mit: echten Daten, bestandener Integritätsprüfung, mindestens 20 aufgelösten Ereignissen, mindestens 3 Modellen mit Wertung auf mindestens 80 % der gemeinsamen Ereignisse und einer vorab festgeschriebenen Referenz.
- Krypto
- keine Referenz festgeschrieben
- Aktienindex
- nur 15 aufgelöste Ereignisse
- Wahlen & Politik
- Beispieldaten
- Sport-Mix
- Beispieldaten
Datenstand 05.09.2026, 10:53 UTC · 4 echte Kategorien, 2 Beispiel · 434 Ereignisse erfasst · Seite gebaut 05.09.2026, 10:54 UTC