Radar · 18/07/2026 · investigación

GPT-5.6 Sol cierra otro problema abierto: la arquitectura de agentes cuenta más que el modelo

Dos hilos en Hacker News cuentan la misma historia desde dos ángulos. El primero, con 204 puntos, documenta cómo GPT-5.6 Sol cerró un problema abierto hace unos 30 años en optimización convexa, usando un prompt y subagentes en paralelo. Seis días antes, el 12 de julio, habíamos contado la demostración de la Cycle Double Cover Conjecture: mismo modelo, mismo patrón.

El segundo hilo, con 121 puntos, es la prueba de Charles Azam. Enfrentó Fable 5 y GPT-5.6 Sol en el mismo problema NP-hard, el diseño de una red de fibra óptica con un espacio de búsqueda estimado en torno a 10^1223 soluciones, con 30 minutos de presupuesto cada uno. El resultado es instructivo para quien orquesta agentes.

Por qué te importa. Fable 5 ganó a Sol en configuración estándar (promedio 32.386 contra 34.261) con una varianza mucho más estrecha: 319 puntos de rango contra 1.958. El modelo más fuerte sobre el papel perdió. Azam también muestra que el comando /goal, presente en Claude Code y Codex, reestructura el ciclo de control en lugar de intensificarlo. En Claude Code delega a un modelo evaluador separado que lee la conversación y dice sí o no. En Codex se convierte en estado persistente en SQLite, con herramientas dedicadas. Dos arquitecturas diferentes bajo el mismo comando.

La orquestación cuenta más que el modelo. Si estás delegando tareas difíciles a un agente, es en el ciclo de control donde se gana o se pierde.

En detalle

El hilo de Reddit no ofrece el texto completo de la demostración, pero el título y la discusión en Hacker News (204 puntos, 106 comentarios) indican que GPT-5.6 Sol produjo una prueba cerrada para un problema de optimización convexa que llevaba abierto unos 30 años. La estructura es la misma del resultado del 12 de julio sobre la Cycle Double Cover Conjecture: el modelo orquesta subagentes en paralelo, cada uno con un fragmento del problema, y combina los resultados en una demostración verificada por un matemático.

La prueba de Azam baja a lo práctico. El problema KIRO es real: diseñar una red de fibra óptica para Grenoble, Niza y París, donde cada torre aparece una sola vez, los bucles deben mantenerse por debajo de 30 terminales y el objetivo es minimizar la longitud del cable. Azam lo había resuelto en C++ en 2018, así que tiene una línea base humana. El espacio de búsqueda, incluso en una versión simplificada (19 bucles de 28 terminales, sin ramas), es del orden de 10^1223.

Los números dicen dos cosas. Primero, Fable 5 fue más consistente: en tres ejecuciones sin /goal, los resultados están en un rango de 319 puntos (de 32.197 a 32.516). Sol en el mismo ejercicio abarca 1.958 puntos (de 33.581 a 35.539). Segundo, /goal ganó 4 de 6 ejecuciones pero empeoró el promedio para ambos modelos. A veces encuentra una cuenca mejor, a veces da tiempo a una idea equivocada para madurar.

El detalle más útil está bajo el capó. /goal en Claude Code es un Stop hook a nivel de sesión: después de cada turno del modelo principal, un modelo pequeño (Haiku) lee la conversación y decide si el objetivo se ha alcanzado. No puede usar herramientas ni inspeccionar archivos: solo juzga por el transcrito. En Codex (versión 0.144.4, open source), /goal es persistente: la interfaz guarda el objetivo en SQLite con estado y presupuesto, y el modelo recibe herramientas dedicadas (create_goal, get_goal, update_goal). Cuando el thread se queda inactivo con un goal activo, Codex inyecta un turno de continuación con una auditoría de completamiento. Dos filosofías: Claude delega a otro modelo, Codex pone el estado en el sistema.

Los límites están declarados. Azam probó un único problema, con seis ejecuciones para los dos modelos top y 30 minutos de presupuesto arbitrarios. La implementación de Claude Code es de código cerrado, así que se basa en lo que documenta Anthropic. Para quien construye agentes, la consecuencia práctica es clara: antes de buscar el modelo más fuerte, evalúa cómo tu ciclo de control gestiona el objetivo. El curso sobre cómo orquestar múltiples agentes y el playbook para delegar una tarea multi-paso construyen exactamente esta competencia.

Escribe para buscar en curso, playbooks, skills, papers…