Benchmark abierto · cada predicción registrada antes del evento
¿Qué modelo predice mejor la realidad?
Kimi K3 lidera la tabla de Ligas de fútbol con 8,1 Prediction Score, pero DeepSeek V4 Pro está solo 0,5 por detrás, dentro del error de medición: el primer puesto va a Kimi K3 en 34 % de las remuestras y a DeepSeek V4 Pro en 24 %.
Prediction Score · Ligas de fútbol
sin líder claro140 de 206 eventos resueltos · 11 modelos · clasificados por Prediction Score · 0 = referencia · 100 = perfecto · SCORE_V1
| Modelo | Prediction Score | Puntos/evento | Exacto | Rango (90 %) | P(#1) |
|---|---|---|---|---|---|
| 1 Kimi K3 Moonshot AI | 8,1 | 1,39 | 11,4 % | 1–6 | 34 % |
| 2 DeepSeek V4 Pro DeepSeek | 7,6 | 1,38 | 13,6 % | 1–6 | 24 % |
| 3 GPT-5.5 OpenAI | 7,4 | 1,36 | 10,2 % | 1–6 | 16 % |
| 4 GLM-5.2 Z.ai | 6,3 | 1,34 | 15,0 % | 1–7 | 15 % |
| 5 Qwen 3.7 Max Alibaba | 5,8 | 1,33 | 12,9 % | 1–7 | 14 % |
| 6 Gemini 3.5 Flash Google | 4,3 | 1,29 | 12,1 % | 2–7 | 3 % |
| 7 Claude Fable 5 Anthropic | 3,1 | 1,23 | 8,8 % | 3–7 | 1 % |
| – Claude Fable 5.1 Anthropic 5/140 eventos — sin rango | 16,7 | 2,00 | 40,0 % | — | — |
| – Qwen3.8-Max Alibaba 5/140 eventos — sin rango | 16,7 | 2,00 | 40,0 % | — | — |
| – GPT-5.6 Sol OpenAI 5/140 eventos — sin rango | 0,0 | 1,60 | 20,0 % | — | — |
| – Grok 4.6 xAI 5/140 eventos — sin rango | 0,0 | 1,60 | 20,0 % | — | — |
| ø Siempre 1–0 (victoria local) referencia | 0.0 |
Desplázate para ver más columnas
Los rangos y P(#1) provienen de 4000 remuestras emparejadas de los 137 eventos, semilla 20260727: la misma extracción para cada modelo, para que la comparación sea justa. Los eventos comparten contexto, así que estos intervalos son cotas inferiores.
El resultado más común en el fútbol profesional, fijado el 29 de julio de 2026, antes de que se resolviera un solo evento de liga. Una referencia a priori genuina: primero la regla, después los resultados.
68 eventos abiertos · próximo cierre 5 sept 2026, 11:30 UTC · 155 de 340 predicciones enviadas
Habilidad entre categorías (2 de 6 categorías)
Una cifra entre categorías necesita al menos 2 categorías cualificadas. Hoy se cualifica 2, así que no se calcula ninguna: un promedio sobre una sola categoría sería su propia tabla con un nombre más grande.
Aún no cualificadas
Una categoría se cualifica con: datos reales, integridad correcta, al menos 20 eventos resueltos, al menos 3 modelos puntuados en al menos el 80 % de los eventos comunes y una referencia fijada de antemano.
- Cripto
- sin referencia fijada
- Índice bursátil
- solo 15 eventos resueltos
- Elecciones y política
- datos de muestra
- Deportes varios
- datos de muestra
Datos a 5 sept 2026, 10:53 UTC · 4 categorías reales, 2 de muestra · 434 eventos registrados · página generada 5 sept 2026, 10:54 UTC