Radar · 10/07/2026 · ocurrido el 09/07/2026 · modelos

OpenAI lanza GPT-5.6 con tres variantes y ChatGPT Work

OpenAI ha hecho público GPT-5.6, tras dos semanas de acceso anticipado restringido a organizaciones aprobadas por el gobierno. El modelo llega en tres variantes: Luna (la más pequeña), Terra (media) y Sol (la más grande), con precios desde $1 a $5 por millón de tokens en entrada. Las tres tienen una ventana de contexto de un millón de tokens y un máximo de 128.000 tokens en salida.

Junto a los modelos, OpenAI lanza ChatGPT Work: un agente que se mueve entre apps (Google Drive, Slack, Salesforce) y archivos, permanece en un proyecto durante horas si es necesario, y completa tareas complejas sin que tengas que orquestar cada paso. Sol demuestra capacidades avanzadas: puede ejecutar post-training autónomo en Luna y, en modo Ultra, ha producido una demostración matemática de la Cycle Double Cover Conjecture.

Por qué te afecta. Si usas modelos de lenguaje en tu trabajo diario, la elección se complica: tres tamaños del mismo modelo, cinco niveles de razonamiento (desde Light a xhigh, más Max y Ultra), y ahora un agente que debería gestionar un proyecto completo. La pregunta se vuelve práctica: cuándo Luna es suficiente, cuándo necesitas Sol, y si ChatGPT Work realmente aguanta una jornada de trabajo o se colapsa a mitad del camino. OpenAI publica benchmarks que muestran a Sol por delante de Claude Fable 5 en tareas agentivas largas, pero es el mismo día en que descalifica aproximadamente el 30% de SWE-Bench Pro, un test de programación donde Fable había superado significativamente a Sol. Los números de benchmark deben tomarse en este contexto.

Dónde prestar atención. La página de model guidance de OpenAI lista las nuevas funcionalidades API (tool calling programático, multi-agente, breakpoints de caché). Una comparación independiente ha recopilado los costos de 18 variantes del mismo prompt: desde 0,71 centavos (Luna, sin razonamiento) a 48,55 centavos (Sol, máximo esfuerzo).

En detalle

El contexto: la vista previa limitada

Hace dos semanas OpenAI había lanzado GPT-5.6 solo a organizaciones aprobadas por el gobierno, en una “limited preview” que había generado debate. El 9 de julio la administración Trump dio luz verde pública. Sam Altman lo llamó “el mejor modelo que hemos producido jamás”.

Las tres variantes y precios

Luna, Terra y Sol cuestan respectivamente $1/$6, $2.50/$15, $5/$30 por millón de tokens (entrada/salida). Para comparar, Claude Opus está a $5/$25 y Fable 5 a $10/$50. Pero el precio por millón de tokens no dice mucho: los modelos con razonamiento pueden consumir cantidades muy diferentes de tokens internos para la misma tarea.

Las tres variantes tienen fecha de conocimiento al 16 de febrero de 2026, ventana de contexto de un millón de tokens, y máximo de salida de 128.000 tokens. Los cinco niveles de razonamiento (none, low, medium, high, xhigh) permiten elegir cuánto trabajo interno debe hacer el modelo. Por encima de xhigh están Max y Ultra, que activan sub-agentes paralelos.

Los benchmarks: OpenAI adelante en agentes, atrás en código

OpenAI se enfoca en tareas agentivas largas: en Agents’ Last Exam (55 campos profesionales), GPT-5.6 Sol alcanza 53.6 puntos, superando a Fable 5 por 13.1 puntos. Incluso con razonamiento medio, Sol supera a Fable por 11.4 puntos a un cuarto del costo estimado. Luna y Terra superan a Fable a un dieciseisavo del costo.

En SWE-Bench Pro (un test de programación), Fable 5 había obtenido el 80% contra el 64.6% de Sol. El día antes del lanzamiento, OpenAI publicó un artículo donde estima que aproximadamente el 30% de las tareas de SWE-Bench Pro están “rotas” y aconseja cautela al usar ese benchmark. Un timing que no pasó desapercibido.

ChatGPT Work: el agente que debería gestionar un proyecto completo

ChatGPT Work se describe como un agente que recibe un objetivo y lo completa, moviéndose entre apps y archivos, permaneciendo en un proyecto durante horas. Es impulsado por Codex (la herramienta de programación de OpenAI, ahora fusionada en ChatGPT) y GPT-5.6. Puede acceder a Google Drive, Slack, Salesforce. La promesa es: da una tarea, vuelve cuando esté lista.

El problema es que los agentes autónomos tienden a atascarse o desviarse cuando las tareas se alargan. La capacidad de “permanecer en un proyecto durante horas” es la parte más difícil de verificar sin usarlo realmente.

Sol Ultra y las matemáticas avanzadas

GPT-5.6 Sol, en modo Ultra, ha producido una demostración de la Cycle Double Cover Conjecture, un problema abierto en teoría de grafos. El PDF de la demostración es público. Según OpenAI, Sol también puede ejecutar post-training autónomo en Luna: se auto-mejora entrenando versiones más pequeñas de sí mismo. Son afirmaciones fuertes, que van más allá del uso cotidiano, pero señalan la dirección.

Las nuevas funcionalidades de API

La model guidance lista novedades que cambian cómo se usan los modelos:

  • Programmatic Tool Calling: el modelo escribe y ejecuta JavaScript para orquestar llamadas a herramientas, en lugar de devolver una secuencia de llamadas para ejecutar externamente.
  • Multi-agent: el modelo puede activar sub-agentes para trabajos paralelos y enfocados, directamente desde la API.
  • Prompt cache breakpoints: como Claude, puedes señalar dónde poner los puntos de caché en lugar de confiar en la detección automática.
  • detail: original para imágenes: el modelo no redimensiona la imagen antes de procesarla.

El tool calling programático se parece al mecanismo de dynamic filtering que Anthropic añadió a la búsqueda web: en lugar de devolver resultados sin procesar, el modelo ejecuta código sobre los resultados en un solo turno.

Qué NO sabemos

Quienes tuvieron acceso anticipado a Sol lo describen como “definitivamente muy competente”, pero no mejor que Fable en las tareas complejas de programación que probaron. Es un dato anecdótico, no un benchmark, pero es el tipo de observación que cuenta: la de quien usa modelos a diario.

Aún no sabemos cuánto ChatGPT Work aguanta en proyectos reales y largos, ni cuán confiable es el post-training autónomo de Sol en Luna. Y el hecho de que OpenAI haya descalificado aproximadamente un tercio de SWE-Bench Pro el día antes del lanzamiento plantea la pregunta: ¿qué tan sólidos son los otros benchmarks que citan?

Hacia dónde lleva esto

Ahora los modelos son familias, no individuos. Elegir el modelo correcto para una tarea se convierte en parte del oficio: cuándo Luna es suficiente, cuándo necesitas Terra, cuándo Sol justifica el costo. Y si agentes como ChatGPT Work realmente funcionan, el oficio cambia: pasas de dar instrucciones paso a paso a dar objetivos y verificar que se cumplan. Pero aún estamos en la fase en que las promesas deben verificarse en la práctica, no aceptarse por los comunicados de prensa.

Escribe para buscar en curso, playbooks, skills, papers…