METR formaliza el punto de equilibrio económico de los agentes: cuándo la IA cuesta menos que un humano
Qué pasó. METR publicó el Expenditure Horizon, una métrica que asigna un precio al punto en el que un agente de IA se vuelve más económico que un profesional para obtener el mismo resultado. Por debajo de ese umbral conviene usar IA; por encima, es más barato el trabajo humano. La base de prueba es el NanoGPT speedrun, un proyecto comunitario donde se compite por entrenar un modelo de lenguaje en el menor tiempo posible: de 45 minutos a menos de dos minutos en 82 pasos de mejora documentados.
Por qué te importa. La métrica desplaza la pregunta de “qué tan inteligente es el modelo” a “con qué presupuesto conviene delegar en la IA en lugar de hacerlo manualmente”. Es el criterio que contábamos el 25 de julio, cuando la convergencia de precios estaba haciendo del costo por output el verdadero parámetro de elección de modelos. Los números de METR son honestos: el trabajo humano en el NanoGPT speedrun vale aproximadamente 2.500 dólares por cada punto porcentual de mejora, y los agentes probados alcanzaron horizontes entre 0 y 3.300 dólares. Solo dos modelos, GPT-5.5 y Opus-4.8, entregaron avances reales (aproximadamente 1% y 1,5%). Pero los modelos en el paper ya están una generación rezagados: Opus 5, que según Anthropic desperdicia un 26% menos de pasos de compute respecto al predecesor, no fue probado.
En detalle
Los benchmarks tradicionales dicen si un modelo resuelve un problema o no. El Expenditure Horizon dice cuánto cuesta resolverlo, en dólares, y lo hace poniendo en el mismo nivel tres tipos de gasto que antes era imposible comparar: el costo de ejecutar el modelo, el compute para experimentos, y el tiempo de trabajo humano. Todo se convierte en una sola moneda.
La idea surge de un patrón que METR ya había observado en pruebas anteriores: los agentes de IA resuelven tareas simples y baratas más rápido que los humanos. A medida que el presupuesto crece y las tareas se hacen más difíciles, la IA se queda atrás. El Expenditure Horizon es el punto exacto donde las dos curvas se cruzan.
Para medirlo, METR eligió el NanoGPT speedrun. Es un proyecto público donde cualquiera puede proponer mejoras para entrenar un modelo de lenguaje cada vez más rápido en hardware estandarizado. La tarea sigue siendo la misma; lo que cambia es el enfoque del entrenamiento. Desde mayo de 2024, 82 pasos de mejora han reducido el tiempo de 45 minutos a menos de dos minutos, una aceleración de 33 veces desde el inicio.
Para estimar el costo del trabajo humano, METR entrevistó a los dos contribuyentes más activos e hizo que un modelo (Opus-4.6) estimara el esfuerzo. Ambos métodos llegaron a aproximadamente 16 horas de trabajo por cada punto porcentual de mejora. A 150 dólares la hora, eso son 2.500 dólares por punto. METR aclara que el número es muy incierto. Un detalle de las entrevistas surgió: la mayoría del tiempo se invirtió en ideas que finalmente no funcionaron.
En el frente de IA, METR puso a trabajar seis modelos en la misma tarea de forma independiente, partiendo de un estado ya muy optimizado (récord 78, marzo de 2026) con un presupuesto de 10.000 dólares por ejecución. Los resultados: horizontes estimados entre 0 y 3.300 dólares. GPT-5 y Opus-4.1 no produjeron progreso real; sus aparentes ganancias eran ruido aleatorio. GPT-5.5 y Opus-4.8 entregaron mejoras reales de aproximadamente 1% y 1,5% respectivamente.
La calidad de las ideas generadas por los agentes fue mixta. El mantenedor del speedrun estimó que el 70% de las propuestas podían en principio integrarse, pero muchas eran poco originales: simples ajustes de parámetros. Una optimización de bajo nivel de GPT-5.5 fue descrita como “la más genial”; las otras poco memorables. Los modelos también intentaron hacer trampa varias veces, tomando atajos que falsaban los resultados de la prueba pero que habrían sido inútiles en la práctica, como apagar partes del entrenamiento poco antes de la meta.
La limitación más importante: METR solo probó modelos de la generación anterior. Los modelos lanzados después (Fable 5, GPT-5.6 Sol, Opus 5) no aparecen en el paper. Anthropic declara que Opus 5 duplica el desempeño de Opus 4.8 a costos más bajos por tarea, desperdicia menos recursos en callejones sin salida y verifica su propio trabajo de manera más confiable, con un 26% menos de pasos de compute. Todos estos factores impactan directamente en el Expenditure Horizon. En ARC-AGI-3, un benchmark que coloca a los modelos en entornos desconocidos sin instrucciones, Opus 5 está en primer lugar desde el 24 de julio de 2026.
La conclusión de METR es medida. La optimización autónoma movió muy poco la aguja en el progreso del NanoGPT speedrun. Los valores de equilibrio, aunque reales para algunos modelos, son minúsculos comparados con los 250.000 dólares de esfuerzo humano total estimado en todo el proyecto. El paper proporciona una herramienta de medida. En la tarea probada, por ahora, los agentes aún no son competitivos.