ARC-AGI-3 y el costo del razonamiento: OpenAI triplica puntuaciones, pero oculta los tokens
OpenAI publica resultados sobre ARC-AGI-3: dos configuraciones de API, reasoning enable y context compaction, triplican las puntuaciones de GPT-5.6. ¿Cuántos tokens más cuestan esas configuraciones y cuánto aumenta la latencia? El post no lo dice.
JuliaHub publicó hace poco una evaluación independiente que incluye el costo. Pusieron tres variantes de GPT-5.6 y Claude Fable 5 a resolver cinco problemas de simulación física en un entorno controlado, con verdad fundamental sellada. Los números: Claude Fable 5 obtiene 0,889 de puntuación ponderada a 9,60 dólares por intento, GPT-5.6-terra logra 0,786 a 1,25 dólares. Fable 5 es más preciso, pero cuesta casi ocho veces más por intento.
Como contábamos el 25 de julio, el costo de la respuesta útil se está convirtiendo en el criterio de decisión real. El post de OpenAI lo confirma a su pesar: si los dos parámetros fueran gratis, lo destacarían.
El problema es metodológico. Un benchmark que solo cuenta respuestas correctas, sin pesar el costo de producirlas, cuenta solo la mitad de la historia. Si triplicar la puntuación requiere quemar diez veces los tokens, la decisión operativa cambia. Para quien evalúa modelos en un caso real, el playbook Compara dos modelos en quince minutos sigue siendo el método más honesto: misma tarea, mismos casos de prueba, tabla calidad-costo-latencia en tus datos.
En detalle
Qué mide ARC-AGI-3.
ARC-AGI es el benchmark de François Chollet sobre puzzles visuales en cuadrícula: cada tarea es única, requiere razonamiento fluido y resistencia a la memorización. ARC-AGI-3 es la versión más reciente. Es el tipo de prueba donde un modelo no puede salirse con la suya mediante patrones memorizados: debe generalizar a partir de ejemplos individuales.
Los dos parámetros.
El post de OpenAI habla de dos configuraciones de API. La primera, reasoning enable, mantiene activa la cadena de razonamiento entre turnos en lugar de empezar de cero. La segunda, context compaction, compacta el contexto de la conversación para encajar más material en la ventana. Ambas intercambian tokens (y tiempo) por precisión. El post anuncia un triple en la puntuación y menciona «eficiencia», pero no publica el conteo de tokens consumidos ni la latencia medida.
Los números de JuliaHub.
JuliaHub probó los modelos en un dominio diferente (simulación física, no puzzles visuales), pero con una metodología que incluye el costo. Configuración bloqueada: reasoning effort xhigh, ventana de contexto 1M, presupuesto de tokens 128k. Problemas sellados con verdad fundamental oculta al modelo.
Los resultados:
- Claude Fable 5: 0,889 puntuación ponderada, 9,60 dólares por intento, 16,1 minutos
- GPT-5.6-sol: 0,814, 1,74 dólares, 13,4 minutos
- GPT-5.6-terra: 0,786, 1,25 dólares, 12,6 minutos
- GPT-5.6-luna: 0,727, 3,26 dólares, 25,0 minutos
Fable 5 gana en precisión, pero GPT-5.6-terra cuesta 7,7 veces menos por intento. En un flujo donde necesitas iterar muchas veces, o donde «lo suficientemente bueno» es aceptable, el modelo más económico gana en costo total.
El punto ciego de la evaluación agentica.
JuliaHub plantea un problema más profundo: en simulación física, un modelo puede compilar y ejecutar código limpio mientras codifica física imposible. Los agentes empeoran esto porque escriben sus propias pruebas. La pregunta «¿esto se corresponde con el mundo real?» es más difícil de responder que «¿pasa las pruebas?». Aplica para quien construya agentes que trabajen en dominios donde la verificación no es trivial.
Qué significa para quien lee esto.
Si estás eligiendo un modelo para una tarea repetitiva (extraer datos de documentos, clasificar tickets, generar borradores), el costo por salida útil importa más que la puntuación en un benchmark académico. Un modelo que puntúa 10 puntos más pero cuesta cinco veces tanto no siempre es la mejor opción: depende de cuántas veces lo ejecutes y cuánto valga un error adicional. Los dos parámetros de OpenAI existen en la API: quien los active debería rastrear el consumo de tokens antes y después, en su propia carga de trabajo, no en ARC-AGI-3.
Limitaciones.
Los datos de JuliaHub cubren cinco problemas en un solo dominio. Los números de OpenAI están en ARC-AGI-3, un benchmark diferente. Los dos conjuntos de datos no son directamente comparables. Lo que comparten es la lección metodológica: incluye el costo en la evaluación. Una puntuación triple sin el precio en tokens sigue siendo una afirmación de marketing, no una decisión operativa.