Radar · 31/07/2026 · ocurrido el 30/07/2026 · negocio

GPT-5.6 Luna a 0,20 dólares por millón de tokens: la frontera cuesta menos que los compactos

OpenAI ha reducido el 80% del precio de GPT-5.6 Luna. El modelo cuesta ahora 0,20 dólares por millón de tokens de entrada y 1,20 en salida (fuente: OpenAI, 30 de julio de 2026). El modelo más grande de la familia, Terra, recibió un corte del 20%.

Para quienes construyen agentes, las matemáticas de la elección de modelo cambian. Hasta ayer la compensación era clara: modelo frontier para tareas difíciles, modelo compacto para el resto, porque el frontier costaba demasiado para usarlo en todo. Ahora Luna cuesta menos que Gemini 3.1 Flash-Lite y una quinta parte de Claude Haiku 4.5 en entrada. La frontera entre modelo capaz y modelo económico se estrecha.

El corte es posible gracias a GPT-5.6 Sol, que OpenAI utilizó para reescribir los kernels de inferencia (el código que ejecuta los cálculos del modelo en GPU) en Triton y Gluon, dos lenguajes GPU open-source del laboratorio. El serving end-to-end cuesta un 20% menos, y OpenAI ha trasladado el ahorro a los precios.

Como comentábamos el 25 de julio, la elección del modelo está pasando de benchmarks al costo por output verificado. Con Luna a este precio, muchas tareas que terminaban en un modelo compacto para ahorrar pueden volver a un frontier sin que la factura cambie.

En detalle

El precio de Luna antes del corte era igual al de Claude Haiku 4.5 en entrada: 1 dólar por millón de tokens. Con el nuevo listado a 0,20 dólares, el costo de entrada baja cinco veces. En salida la diferencia es menos extrema (1,20 contra 5 dólares de Haiku 4.5), pero sigue siendo significativa. La comparación con Gemini 3.1 Flash-Lite es contundente: Luna cuesta menos, siendo a la vez un modelo de la familia frontier de OpenAI.

Qué hace posible el corte. OpenAI atribuye el ahorro a GPT-5.6 Sol, el modelo de la familia optimizado para razonamiento profundo. Sol trabajó en dos frentes: el balanceo de carga y, más importante, la reescritura de los kernels de inferencia. Los kernels son el código que ejecuta las operaciones matemáticas del modelo en GPU. Cuando las operaciones individuales ya son rápidas, lo que ralentiza es el movimiento de datos en memoria, la sincronización entre operaciones y los layouts de datos ineficientes. Sol encontró cálculos que se podían precomputar, evitar o paralelizar, y reescribió los kernels de producción en Triton y Gluon, dos lenguajes GPU open-source mantenidos por OpenAI. El resultado declarado es una reducción del 20% en el costo de serving end-to-end.

Qué cambia para quienes construyen. Si tienes un agente que usa un modelo compacto para mantener costos bajos, el cálculo debe rehacerse. Un agente de búsqueda que procesa cientos de documentos, un triage de correos, un asistente que responde preguntas frecuentes: tareas donde la calidad del compacto era «suficientemente buena» pero el frontier era demasiado caro. Con Luna a 0,20 dólares por millón de tokens de entrada, la lectura de un documento largo (digamos 10.000 tokens) cuesta una fracción de centavo. La diferencia de calidad entre un frontier y un compacto, en tareas que requieren comprensión y criterio, puede justificar ese gasto.

Un indicador concreto: un agente demo en Datasette que corría en Gemini 3.1 Flash-Lite fue migrado a Luna el mismo día del anuncio.

Dónde prestar atención. Los precios publicados son los oficiales de OpenAI. En proveedores terceros (Bedrock, Azure) los listados pueden diferir, y el prompt caching cambia aún más el cálculo. El corte del 20% en costos de serving es una declaración de OpenAI, no un número verificado por terceros. Y el precio por token no es el único costo de un agente en producción: latencia, número de llamadas, reintentos y overhead de orquestación pesan tanto como el listado.

Para decidir si Luna te conviene en tu caso, el método sigue siendo el mismo: misma tarea, mismos casos de prueba, tabla de resultados con costo y calidad. El playbook para hacerlo en un cuarto de hora está aquí.

Escribe para buscar en curso, playbooks, skills, papers…