Radar · 13/07/2026 · ocurrido el 12/07/2026 · coding

Migración de un agente de producción a GPT-5.6: 2.2x más rápido, 27% más económico

Ploy, la plataforma que construye sitios de marketing con un agente, migró su sistema de Claude Opus 4.8 a GPT-5.6 Sol. Los números en cargas de trabajo reales: 2.2 veces más rápido para completar un build, 27% más económico, la mitad de tokens de output. No fue solo cambiar un nombre en la configuración.

El equipo de Ploy documenta las tres trampas de una migración real: llamadas a tool con 25 parámetros enviados todos incluso cuando no son necesarios (Claude envía 2 o 3, GPT-5.6 los llena todos inventando valores), prompt caching que se comporta diferente entre proveedores, y replay del razonamiento entre turnos que cambia de estrategia. Cada diferencia requirió modificaciones en su suite de evaluación antes de tocar el agente.

Por qué te importa. Si tienes un agente en producción en Claude y estás evaluando GPT-5.6, espera comportamientos distintos enmascarados por el SDK universal. El post es una guía de migración escrita por quienes la hicieron de verdad, con trazas completas y comparaciones lado a lado en builds reales. No es un benchmark sintético: es la misma tarea (construir una homepage desde una referencia) ejecutada por dos modelos, medida con los mismos criterios, con las diferencias documentadas archivo por archivo.

En detalle

El contexto: cuatro meses con Opus como default

Desde marzo de 2026, Ploy mantuvo Claude Opus como modelo de default para su agente de construcción de sitios. Opus 4.7 primero, luego 4.8. Cada lanzamiento frontier se probaba contra él, y ninguno resistía la comparación en su carga de trabajo: construir componentes React, generar imágenes, hacer screenshots, decidir cuándo terminó el trabajo. GPT-5.6 fue el primer modelo en superar esa prueba.

Qué cambió en los números

La tabla que Ploy publica compara 11 builds completos con Opus contra 10 con GPT-5.6, misma suite de pruebas. Costo promedio por build: de $3.06 a $2.22. Tiempo: de 8 minutos a 3 minutos 42 segundos. Tokens de output: de 33.000 a 17.100. El visual score (evaluación de diseño en 10 criterios binarios) sube levemente: 0.936 contra 0.970.

GPT-5.6 escribe código más compacto: en un caso comparado, Opus produjo un archivo CSS de 17.957 caracteres con 174 variables CSS (rampa de colores completa, en su mayoría sin usar), GPT-5.6 escribió 2.508 caracteres y 45 variables para una página renderizada comparable.

Las tres trampas ocultas

Llamadas a tool con todos los parámetros. La herramienta code de Ploy tiene 25 parámetros top-level, uno obligatorio (action) y el resto opcionales. Claude envía solo los que usa. GPT-5.6 los envía todos, cada vez, inventando valores plausibles para los que no necesita: offset: 0, timeout: 120000, siteId: 00000000-0000-0000-0000-000000000000. Tres días de trazas en producción: 6.635 llamadas code(read), todas con 25 propiedades. Este patrón obligó a Ploy a revisar la validación de argumentos de tool.

Prompt caching diferente entre proveedores. Ploy usa caching para evitar pasar el codebase completo en cada turno. Anthropic y OpenAI implementan esta función con reglas distintas sobre qué se cachea y cuánto dura. La migración requirió rehаcer pruebas sobre cuándo realmente ocurre el cache hit, porque los supuestos válidos para Claude no se sostenían con GPT-5.6.

Replay del razonamiento. Entre un turno y el siguiente, el agente debe ver su trabajo anterior para decidir el próximo paso. Claude tiende a una estrategia secuencial (un archivo por vez), GPT-5.6 emite llamadas paralelas. Su executor de evaluación no soportaba lotes de lecturas de archivo, algo que Opus usaba raramente y GPT-5.6 usa constantemente. Aproximadamente un tercio de los fallos en la primera corrida cross-modelo se trazaban a límites del test harness, no del modelo.

Diseño: limpio, pero uniforme

El equipo de Ploy nota una convergencia estilística: GPT-5.6 produce layouts muy limpios, modernos, en grilla apretada, pero tiende hacia ese look sin steering explícito. Con su viejo harness diseñado para Opus 4.8, GPT-5.6 tendía a ignorar los design systems existentes y producir output visualmente genérico, aunque técnicamente correcto. Ploy comenta que la solución merece un post dedicado, y que con su equipo de diseño lograron obtener “adherencia de marca de nivel mundial que no se consigue out of the box”.

Implicaciones para quienes evalúan una migración

Si usas Claude en producción y estás mirando GPT-5.6, el takeaway de Ploy es claro: tu suite de evaluación está sintonizada en el modelo incumbent más de lo que crees. Presupuestos de llamadas a tool dimensionados para el estilo de un modelo, executors que asumen comportamientos específicos, umbrales invisibles heredados de defaults. Antes de confiar en un pass rate cross-modello, revisa las trazas una por una. Si no, estás midiendo qué tan bien el nuevo modelo imita al viejo, no qué tan bien resuelve la tarea.

La migración se completó el 9 de julio de 2026, y GPT-5.6 Sol es ahora el default de cada workspace de Ploy. El post original incluye screenshots lado a lado de output reales y las tablas completas de comparaciones.

Escribe para buscar en curso, playbooks, skills, papers…