DeepSeek V4-Flash iguala a GPT-5.6 Luna con un costo por tarea 60% menor
DeepSeek ha lanzado V4-Flash-0731, la actualización de su modelo abierto con 284 mil millones de parámetros totales y 13 mil millones activos (MoE), con contexto de 1 millón de tokens. En el Índice de Inteligencia de Artificial Analysis el modelo pasa de 40 a 50 puntos, un punto por debajo de GPT-5.6 Luna, a un costo por tarea inferior del 60%. Los pesos están abiertos bajo licencia MIT, disponibles inmediatamente en Hugging Face.
El salto de rendimiento proviene enteramente del post-training, sin cambios de arquitectura o tamaño: Terminal-Bench pasa de 56.9 a 82.7, y el uso de tokens de salida cae un 12% respecto al predecesor. El precio de la API es de 0,14 dólares por millón de tokens de entrada y 0,28 de salida, con un descuento del 98% en tokens en caché (0,0028 dólares por millón).
Para quienes construyen agentes, el cálculo cambia rápidamente. El mismo día en que OpenAI reduce un 80% el precio de GPT-5.6 Luna, DeepSeek ofrece un rendimiento casi equivalente a una fracción del costo, con pesos descargables. El compromiso entre modelo capaz y modelo económico, que ayer se había estrechado, hoy se complica: hay un tercer competidor abierto.
Si quieres probarlo: el modelo está disponible en OpenRouter como deepseek/deepseek-v4-flash-0731. El nivel de razonamiento predeterminado deja que desear en algunas tareas; subirlo a “high” cambia los resultados de forma visible.
En detalle
Qué había antes.
Hasta ayer, la guerra de precios entre modelos frontera tenía dos frentes: OpenAI por un lado, Anthropic y Google por otro. Los modelos abiertos chinos (Kimi K3, Qwen 3.8) cerraron la brecha técnica, pero se quedaban atrás en tareas agénticas complejas. V4-Flash en su versión de abril marcaba 56.9 en Terminal-Bench y 40 puntos en el Índice de Inteligencia: útil, pero no sustituto de la frontera.
Qué cambia con la actualización 0731.
El salto es enteramente en post-training. DeepSeek no tocó arquitectura ni tamaño: los mismos 284 mil millones de parámetros totales, los mismos 13 mil millones activos por token (256 expertos, 6 activos). Lo que cambió es la calidad del entrenamiento post-supervisado, especialmente en tareas agénticas como uso de herramientas, planificación multi-paso y razonamiento extendido.
Los números clave, medidos por Artificial Analysis el 31 de julio de 2026:
- Índice de Inteligencia: 40 → 50 (GPT-5.6 Luna está en 51)
- Terminal-Bench: 56.9 → 82.7
- GDPval-AA v2 Elo: 1189 → 1559
- Tokens de salida: -12% respecto al predecesor
El precio de la API en primer tier es agresivo: 0,14 dólares por millón de tokens de entrada, 0,28 de salida. El descuento en tokens en caché es del 98% (0,0028 dólares por millón), un nivel que cambia el costo real cuando un agente trabaja en un contexto largo y estable.
Detalles técnicos para no ingenieros.
V4-Flash es una Mixture of Experts: 284 mil millones de parámetros distribuidos en 256 expertos, pero por cada token generado activa solo 6. Es como tener un equipo de 256 especialistas y llamar a 6 para cada pregunta. Esto mantiene bajos los costos de inferencia a la vez que preserva una capacidad total similar a modelos mucho más grandes. El modelo soporta tres niveles de esfuerzo de razonamiento e incluye un módulo de speculative decoding que se activa con una bandera.
Los pesos abiertos, y por qué importa.
Los pesos salieron bajo licencia MIT el mismo día que la API. Puedes descargar el modelo, alojarlo en tus servidores, modificarlo. No estás vinculado a la API de DeepSeek. Las versiones cuantizadas para uso local funcionan con 168 GB de RAM para 4-bit y 110 GB para 3-bit.
Esto sucede mientras la Casa Blanca evalúa prohibiciones selectivas en modelos open-weight chinos y los laboratorios propietarios hacen frente común sobre los riesgos de los pesos abiertos. Para quienes construyen sobre modelos abiertos, la disponibilidad de un modelo competitivo bajo MIT es un hecho concreto: cuantos más proveedores lo ofrecen, más redundante es la infraestructura.
Limitaciones.
El modelo es solo texto: sin visión, sin audio. El salto de rendimiento se mide en los benchmarks de Artificial Analysis y la comunidad, no en una evaluación independiente de terceros. El nivel de razonamiento predeterminado produce resultados decepcionantes en algunas tareas: necesitas subirlo a “high” para obtener lo mejor, lo que aumenta costo y latencia. Es una beta pública: el comportamiento puede cambiar.