Radar · 07/08/2026 · ocurrido el 05/08/2026 · investigación

HarnessOpt-Bench: el primer benchmark que mide lo que realmente importa: la orquestación, no el modelo

Scale AI publicó HarnessOpt-Bench, un benchmark que mide la capacidad de los modelos frontier para optimizar el harness: el conjunto de prompts, herramientas, flujo de control, memoria y código de orquestación que rodea a un modelo dentro de un sistema agentico. El benchmark proporciona a un LLM el harness inicial de un agente objetivo, un presupuesto fijo de evaluaciones, y luego mide la ganancia normalizada en un conjunto de pruebas que permanece inaccesible durante la búsqueda.

Por qué te importa. Como contábamos el 1 de agosto cuando Manifest cerró su router para enfocarse en la orquestación, el cuello de botella de los sistemas agentivos se desplazó de la selección del modelo a cómo lo orquestas. HarnessOpt-Bench proporciona la primera métrica compartida para medir precisamente esto. Los resultados de 111 ejecuciones con 5 modelos frontier muestran dos cosas: los modelos optimizadores se distinguen más que los harness que los rodean, y usar el harness nativo del modelo no garantiza mejores resultados.

Para quien construye agentes, es la confirmación empírica de una intuición que ya se estaba volviendo operativa. Ahora hay un número para decirlo. El artículo sobre por qué los agentes fallan ya lo había mostrado cualitativamente: casi nunca es el modelo, casi siempre son los pasos.

En detalle

Hasta hoy los benchmarks medían modelos. SWE-bench mide si un agente resuelve problemas reales de GitHub, GAIA mide si un asistente responde preguntas que requieren investigación y cálculo, pero nadie medía sistemáticamente la calidad del andamiaje que rodea al modelo: los prompts, las herramientas, el flujo de control, la memoria, el código que orquesta todo. HarnessOpt-Bench cierra este vacío.

El setup está diseñado para evitar el sobreajuste. Un modelo optimizador, acoplado a un harness de codificación, recibe el harness inicial de un agente objetivo, retroalimentación de evaluación gradual y un presupuesto fijo de evaluaciones. Modifica el harness, propone un candidato final y se juzga por la ganancia normalizada respecto al harness inicial en un conjunto de pruebas que no puede ver durante la búsqueda. Un entorno de ejecución controlado hace cumplir el límite: mide los recursos utilizados por el agente objetivo, impide el acceso a datos de prueba y conserva versiones de candidatos para auditoría.

Los números cuentan dos cosas. Primero: la elección del modelo optimizador importa más que el harness de codificación a través del cual actúa. En 111 ejecuciones, los 5 modelos frontier probados se separan claramente, mientras que harness diferentes producen resultados menos diferenciados. Segundo: el harness nativo del modelo, el que fue entrenado con él o que proporciona su productor por defecto, no gana de manera consistente. La ventaja de usar el mismo entorno del productor del modelo es real en algunas tareas pero desaparece en otras.

Esto significa que el trabajo de ingeniería del harness, el que muchos ya están haciendo manualmente, tiene un impacto medible y no es un detalle secundario comparado con la elección del modelo base. Si cambias los prompts, ajustas el flujo de control, optimizas la memoria o redefinís las herramientas, estás haciendo exactamente lo que el benchmark mide.

Los límites están declarados. Las evaluaciones son costosas y estocásticas, lo que significa que una ganancia medida puede variar entre ejecuciones sucesivas. Las 4 tareas downstream cubren tipos diferentes de trabajo pero siguen siendo una muestra estrecha. Los 5 modelos frontier son los protagonistas del momento, pero la fotografía es válida hasta que salgan los próximos. El paper mismo concluye que hay mucho espacio para mejorar: las ganancias varían mucho según la tarea y el harness inicial, y ningún modelo es bueno en todo.

Para quien construye agentes, el mensaje operativo es la continuación natural de una tendencia que el sitio ha estado siguiendo durante semanas. La infraestructura del medio, la orquestación, la memoria, los controles de calidad, importan más que el modelo base. Ahora hay un benchmark para demostrarlo con números, y esto significa que puedes medir si una intervención en la arquitectura del agente realmente proporciona una ganancia, en lugar de confiar en la impresión o en la demo que funciona una de cada tres veces.

Escribe para buscar en curso, playbooks, skills, papers…