Radar · 22/07/2026 · ocurrido el 21/07/2026 · modelos

GPT-5.6 gasta 8 dólares donde Claude Fable 5 quema 160 en la misma tarea

TryAI puso cuatro modelos frontier ante un lienzo en blanco y un conjunto de lápices de colores virtuales. GPT-5.6 Sol, Claude Fable 5, Grok 4.5 y Gemini 3.6 Flash debían reproducir la Mona Lisa y otras imágenes con las mismas herramientas. En siete dibujos, Claude Fable 5 gastó 160 dólares en tokens contra los 7,74 de GPT-5.6, produciendo resultados peores en esta tarea específica (datos TryAI, 21 de julio de 2026). Fable usó 14,6 millones de tokens en 54 pasos promedio, GPT-5.6 usó 3,4 millones en 29 pasos.

El mismo día el equipo de Claude Code contó en una entrevista pública cómo Anthropic usa sus propias herramientas. El system prompt de Claude Code se redujo un 80 por ciento: los modelos recientes ya no necesitan ejemplos en el prompt, y las listas de prohibiciones empeoran la calidad. Claude Tag, la integración Slack colaborativa, cierra el 65 por ciento de los PR del equipo de ingeniería.

Los benchmarks estándar te dicen cuál modelo es más capaz en promedio. La prueba de TryAI te dice cuánto te cuesta producir un output utilizable en una tarea concreta, y muestra que la relación precio-calidad se invierte completamente de una tarea a otra. Claude Fable 5 supera a GPT-5.6 en otras tareas, como contamos con el desafío sobre clips musicales, pero aquí cuesta veinte veces más por un resultado peor.

La economía operativa es el dato que necesitas cuando eliges un modelo para tu trabajo, no la clasificación general. Anthropic misma trabaja con esta lógica: reduce el prompt y automatiza los PR, probando features en sus propios empleados antes de lanzarlas.

Si quieres medir el costo real en tus casos, el playbook para comparar dos modelos en un cuarto de hora te da el método.

En detalle

La prueba de TryAI está construida para ser legible a simple vista. Cada modelo recibe el mismo conjunto de herramientas virtuales: elegir color, grosor y presión del trazo, dibujar lotes de marcas, difuminar, borrar, y llamar a view_canvas para ver el propio trabajo y corregirlo. Sin rellenos sólidos: el tono se construye por capas, como con lápices reales. La similitud con la imagen objetivo se mide con SSIM, una métrica objetiva de similitud estructural.

Los números cuentan una historia clara. Claude Fable 5 usó 14,6 millones de tokens en siete dibujos, contra los 3,4 millones de GPT-5.6. Hizo en promedio 54 pasos contra 29, empleando 12,5 minutos contra 6,2. Y gastó 160 dólares contra 7,74. El resultado visual, medido por SSIM, fue peor.

Esto significa que Fable es un modelo con puntos débiles en este tipo específico de tarea, aunque destaca en otros. TryAI lo señala abiertamente: Fable había ganado a GPT-5.6 en el desafío anterior sobre videos musicales, y Anthropic lo usa internamente para tareas donde destaca. En este tipo de tarea, un modelo que razona mucho y hace muchas auto-correcciones quema presupuesto sin un retorno proporcional. Grok 4.5 usó 99 pasos y 354 llamadas draw, pero empezó mal y tuvo dificultades para corregir. Gemini 3.6 Flash pasó más tiempo mirando el lienzo que dibujando.

Los cuatro modelos usaron las mismas herramientas de formas completamente diferentes. GPT-5.6 nunca llamó a set_color, set_brush o set_pressure por separado: lo configuró todo inline en cada llamada draw. Claude Fable hizo en promedio 15,6 auto-correcciones por dibujo, el doble que cualquier otro.

La entrevista con el equipo Claude Code cuenta la misma economía desde el lado de quien construye las herramientas. Cat Wu y Thariq Shihipar describieron un cambio de ritmo: con Fable se pueden completar en un solo intento features que antes requerían supervisión constante. El system prompt de Claude Code se redujo un 80 por ciento porque los modelos recientes ya no necesitan ejemplos en el prompt. Las listas de “no hacer X” reducen la calidad de resultados con modelos nuevos.

Thariq dijo algo que suena herético para un ingeniero de software: ahora los rewrite funcionan. Si tienes un buen conjunto de tests, reescribir desde cero con un agente cuesta menos que mantener código legacy. El código en sí es una especificación, y a menudo la única copia que tienes.

Los límites de la comparación de TryAI están declarados. Las pruebas son tareas deliberadamente abiertas y difusas. Los modelos open-weight probados ni siquiera eran usables, varios devolvieron un lienzo blanco. La prueba separa los frontier del resto pero no dice cuál sea mejor en general. Dice cuánto cuesta producir un output en esa tarea, y si vale lo que gastaste.

Escribe para buscar en curso, playbooks, skills, papers…