Comprobantes
¿Qué modelo de IA anticipa mejor el futuro? Los modelos de lenguaje compiten en varios ámbitos: deporte, mercados bursátiles y elecciones. Cada predicción se publica antes del evento y toda puntuación puede recalcularse.
0 de 2243 predicciones puntuadas tienen prueba de commit independiente. La ronda completada se importó como una única instantánea, así que sus marcas de tiempo las declara el propio ejecutor: por eso aquí figura 0 y no una cifra más halagadora. La primera ronda cuyo commit precede a sus eventos cierra el 5 sept 2026, 11:30 UTC.
Antelación en 2243 predicciones: mediana 46 h, percentil diez 35 h, mínimo 20 min. 80 se enviaron menos de 24 horas antes de su evento. Esas 2243 predicciones tienen 1627 marcas de envío distintas: se registraron por lotes, no una a una.
La contaminación queda excluida por construcción: todo modelo clasificado se publicó antes del primer evento puntuado — 20 días entre el lanzamiento más reciente (Qwen 3.7 Max, 22 may 2026) y el primer evento (11 jun 2026, 19:00 UTC). Los resultados no existían cuando se entrenaron estos modelos. Excluye 4 participante sin fecha de lanzamiento pública.
Una única plantilla de prompt para cada modelo, versión HARNESS_V2. El texto exacto está en la página de metodología.
Comprueba una predicción tú mismo
- evento
- Argentina – Switzerland · 12 jul 2026, 01:00 UTC
- predicción
- Qwen 3.7 Max · registrada el 16 jun 2026, 08:22 UTC, 25,7 d antes del evento
- resultado
- Diferencia de goles correcta · 3 puntos
Cada archivo de predicciones está en un repositorio público. Este comando muestra cuándo apareció su contenido:
git log --format='%H %cI' -- public/arena-data/football-worldcup/predictions.json
Cómo citar
FutureBench, www.futurebench.ai — subconjunto Ligas de fútbol, 140 eventos resueltos, datos a 5 sept 2026, 10:53 UTC.
Los laboratorios pueden evaluar un modelo no publicado: la fila permanece oculta hasta su lanzamiento, los resultados se publican cuando el modelo sea público — o no se publican — y el protocolo no cambia para nadie.
Lo que esto no afirma
- 4 de 6 categorías tienen resultados reales, 0 están conectadas a eventos reales pero aún sin respuestas de modelos, y 2 funcionan con datos de muestra.
- Los eventos no son independientes, y tampoco las respuestas: 1373 de 2907 pares de modelos predijeron el mismo resultado (47 %). La muestra efectiva es menor de lo que sugiere el número de eventos.
- Se mide un modelo que responde con lo que ya sabe: sin búsqueda, sin navegación, sin herramientas, solo la pregunta y un breve bloque de contexto. Hay una respuesta por modelo y evento, así que la varianza del modelo no puede separarse de la dificultad del evento.