Belege
Welches KI-Modell schätzt die Zukunft am besten ein? Hier treten Sprachmodelle in mehreren Domänen gegeneinander an – Sport, Aktienmärkte, Wahlen. Alle Vorhersagen werden vor dem Ereignis veröffentlicht, jede Wertung ist nachrechenbar.
0 von 2.243 gewerteten Vorhersagen tragen einen unabhängigen Commit-Beweis. Die abgeschlossene Runde wurde als einzelner Schnappschuss übernommen, ihre Zeitstempel stammen also vom Runner selbst – deshalb steht hier 0 und keine schönere Zahl. Die erste Runde, deren Commit vor ihren Ereignissen liegt, schließt 05.09.2026, 11:30 UTC.
Vorlaufzeit über 2.243 Vorhersagen: Median 46 h, zehntes Perzentil 35 h, Minimum 20 min. 80 wurden weniger als 24 Stunden vor dem Ereignis abgegeben. Diese 2.243 Vorhersagen tragen 1.627 verschiedene Abgabezeitpunkte – sie wurden in Stapeln eingereicht, nicht einzeln.
Kontamination ist konstruktiv ausgeschlossen: Jedes gerankte Modell erschien vor dem ersten gewerteten Ereignis – 20 Tage zwischen der jüngsten Veröffentlichung (Qwen 3.7 Max, 22.05.2026) und dem ersten Ereignis (11.06.2026, 19:00 UTC). Die Ausgänge existierten beim Training dieser Modelle nicht. Ohne 4 Teilnehmer ohne öffentliches Erscheinungsdatum.
Ein Prompt-Template für jedes Modell, Version HARNESS_V2. Der genaue Wortlaut steht auf der Methodikseite.
Eine Vorhersage selbst nachprüfen
- Ereignis
- Argentina – Switzerland · 12.07.2026, 01:00 UTC
- Vorhersage
- Qwen 3.7 Max · festgehalten 16.06.2026, 08:22 UTC, 25,7 d vor dem Ereignis
- Ergebnis
- Richtige Tordifferenz · 3 Punkte
Jede Vorhersage-Datei liegt in einem öffentlichen Repository. Dieser Befehl zeigt, wann ihr Inhalt zuerst auftauchte:
git log --format='%H %cI' -- public/arena-data/football-worldcup/predictions.json
Zitieren
FutureBench, www.futurebench.ai – Teilmenge Fußball-Ligen, 140 aufgelöste Ereignisse, Datenstand 05.09.2026, 10:53 UTC.
Labore können ein unveröffentlichtes Modell werten lassen: Die Zeile bleibt verborgen, bis es erscheint, Ergebnisse werden veröffentlicht, sobald das Modell öffentlich ist – oder gar nicht – und das Harness ändert sich für niemanden.
Was das nicht behauptet
- 4 von 6 Kategorien tragen echte Ergebnisse, 0 hängen an echten Ereignissen, haben aber noch keine Modellantworten, und 2 laufen auf Beispieldaten.
- Ereignisse sind nicht unabhängig, die Antworten auch nicht: 1.373 von 2.907 Modellpaaren tippten dasselbe Ergebnis (47 %). Die effektive Stichprobe ist kleiner, als die Ereigniszahl vermuten lässt.
- Gemessen wird ein Modell, das aus dem antwortet, was es ohnehin weiß: keine Suche, kein Surfen, keine Werkzeuge – nur die Frage und ein kurzer Kontextblock. Es gibt eine Antwort je Modell und Ereignis, deshalb ist Modellstreuung nicht von Ereignisschwere zu trennen.