Radar · 21/07/2026 · ocurrido el 19/07/2026 · investigación

WorldCupArena: el benchmark que evalúa agentes sobre lo que aún desconocen

Un grupo de investigadores ha publicado WorldCupArena, un benchmark que evalúa modelos de lenguaje y agentes de deep-research en la predicción de partidos de fútbol. Antes de cada encuentro, el sistema recibe un paquete de información o busca por su cuenta, luego predice resultado, marcador, jugadores clave y estadísticas. Después del partido, las predicciones se contrastan con el resultado real. La primera evaluación cubre 104 partidos del Mundial 2026 en 13 sistemas.

Por qué te importa. Los benchmarks tradicionales miden lo que sabe un modelo en el momento del entrenamiento. WorldCupArena mide qué descubre y combina un agente cuando los datos cambian continuamente. Es el mismo problema que enfrentas cuando le pides a un asistente que prepare una oferta con las noticias de hoy, o que analice un mercado en movimiento. La capacidad de buscar información fresca, filtrarla y tomar posición antes de que la respuesta esté disponible es la habilidad que separa un agente útil de un modelo que repite el pasado.

Los resultados son honestos: respecto a las cuotas de las casas de apuestas y los aficionados humanos, el mejor sistema muestra ganancias pequeñas en resultado y marcador exacto. La ganancia neta llega en la métrica Scoreline, que otorga crédito parcial cuando el marcador predicho está cerca del real. Los modelos con la misma precisión en el resultado se diferencian en predicciones de detalle, donde el razonamiento importa más que la memoria.

Si quieres intentarlo: el código, los prompts y los scripts de evaluación son open source en el repositorio GitHub del proyecto.

En detalle

Qué había antes.

Los benchmarks para LLM tienen un problema estructural: miden conocimiento congelado al momento del entrenamiento. MMLU, HumanEval, SWE-bench prueban cosas de las que el modelo probablemente ya “leyó” en los datos de entrenamiento. Incluso GAIA, que hemos descrito como el termómetro más honesto para asistentes generales (el paper está aquí), utiliza preguntas con respuesta ya conocida en el momento de la prueba.

WorldCupArena invierte el enfoque: elige eventos que aún no han sucedido. El modelo no puede tener la respuesta en sus pesos, porque la respuesta no existe aún. Debe buscarla, combinarla y tomar posición antes de que se juegue el partido.

Cómo funciona, en términos simples.

Antes de cada partido, el sistema recibe una de dos cosas: un paquete de evidencia estandarizado (mismos datos para todos los modelos, para compararlos en igualdad de condiciones) u acceso a búsqueda libre en la web. El modelo debe entonces predecir el resultado (victoria, empate, derrota), el marcador exacto, los jugadores y eventos clave, las estadísticas del partido y el resultado del torneo.

Después del silbato final, cada predicción se contrasta con el resultado registrado. La puntuación no es binaria: la métrica Scoreline asigna crédito parcial cuando el marcador predicho está cerca pero no es exacto, y este es el punto donde más se diferencian los modelos.

Qué dicen los números.

104 partidos, 13 sistemas probados. El dato más interesante es la comparación con dos líneas base externas: las cuotas de las casas de apuestas y las predicciones de aficionados humanos. El mejor sistema supera estas líneas base levemente en resultado y marcador exacto. La ganancia llega en la métrica Scoreline y en predicciones de detalle.

Qué significa: las casas de apuestas ya son muy buenas prediciendo quién gana, porque lo hacen desde hace décadas con modelos estadísticos refinados. La ventaja de un agente IA emerge en análisis más finos (quién anota, cómo se desarrolla el partido, qué eventos son probables). Modelos con la misma precisión bruta en el resultado se separan cuando los observas en detalle.

Limitaciones.

La muestra es de 104 partidos: consistente pero no enorme, y el fútbol es notoriamente impredecible. Las ganancias pequeñas en predicciones de resultado podrían reflejar la dificultad intrínseca de la tarea más que los límites de los modelos. El benchmark está diseñado para reutilizarse: nuevos calendarios se agregan conforme avanzan las competiciones, y los modelos futuros se evalúan sin que los resultados anteriores sean ya conocidos.

El paper fue publicado en Hugging Face el 20 de julio de 2026, con código, prompts y scripts de evaluación open source en el repositorio GitHub del proyecto.

Escribe para buscar en curso, playbooks, skills, papers…