Radar · 27/07/2026 · ocurrido el 21/07/2026 · modelos

Gemini 3.6 Flash y el catálogo reducido de Google: eficiencia y especialización en modelos compactos

Google ha presentado tres nuevos modelos Gemini de la serie Flash. 3.6 Flash es el modelo principal, con eficiencia mejorada: consume un 17% menos de tokens en output que 3.5 Flash según el Artificial Analysis Index, con una reducción del costo por token a $1.50/1M en entrada y $7.50/1M en salida. 3.5 Flash-Lite apunta a la velocidad (350 tokens/segundo) y al costo mínimo. 3.5 Flash Cyber es un modelo especializado para seguridad del código, integrado con el agente CodeMender.

La elección entre modelos frontier se está desplazando del benchmark abstracto hacia la especialización de uso y el costo por output verificado. Lo vimos con la convergencia en Bedrock y Opus 5 a mitad de precio: ahora la pregunta es «¿cuál es el modelo que resuelve una tarea específica gastando lo justo?». El movimiento de Google con Flash Cyber hace explícito este cambio de perspectiva.

Los nuevos modelos son la respuesta de Google a la presión de Anthropic y OpenAI, y la reducción de verbosidad (menos pasos de razonamiento, menos llamadas a herramientas) se traduce en agentes que cuestan menos por tarea completada. Para quien construye workflows agentivos, el ahorro de tokens en el workflow agentico es el parámetro a medir antes de migrar.

Para saber si la reducción de tokens es real en tu trabajo, el método sigue siendo la prueba de laboratorio: mide el costo por output verificado en tus tareas. El playbook para comparar dos modelos en un cuarto de hora te da la estructura para hacerlo sin dejarte llevar por los números del marketing.

En detalle

El anuncio de Google describe 3.6 Flash como una actualización construida sobre el feedback de quienes han usado 3.5 Flash en producción. El salto está en la eficiencia del ciclo agentico: el modelo ejecuta menos pasos de razonamiento y menos llamadas a herramientas para completar una tarea multi-paso. En el benchmark DeepSWE de Datacurve, Google reporta una reducción de hasta el 65% en tokens de salida. Es un número que debe leerse con cautela: los benchmarks de coding agentico son sensibles a la configuración del harness, y DeepSWE mide un caso específico. Una reducción del 65% en un benchmark no garantiza el mismo ahorro en tu workflow, porque el número de pasos depende del tipo de tarea, de las herramientas conectadas y de cómo el prompt del sistema instruye al agente. El 17% en el Artificial Analysis Index es el dato más sólido porque proviene de una referencia tercera y estandarizada, y es el que debes usar como estimación prudente cuando hagas las cuentas.

El pricing de 3.6 Flash ($1.50/1M entrada, $7.50/1M salida) es menor que el de 3.5 Flash. El modelo busca el punto de equilibrio entre eficiencia y calidad, que es exactamente el mercado donde OpenAI y Anthropic están presionando: modelos compactos que cuesten poco por tarea completada, en lugar de modelos frontier al máximo que queman presupuesto. Para quien construye agentes que corren en ciclo continuo, la diferencia de precio por token se multiplica rápidamente: un agente que ejecuta veinte pasos por tarea, cada uno con 500 tokens de salida, pasa de un costo por tarea de $0.10 a $0.075. En mil tareas al día son $25 de ahorro diario, cifras a verificar en tu carga real pero que muestran por qué el precio por token se ha convertido en un parámetro operativo.

3.5 Flash Cyber es la novedad más interesante desde el punto de vista del patrón. Google lo presenta como «un modelo especializado para ciberseguridad integrado con el agente CodeMender». El mensaje es que la seguridad del código se resuelve con un modelo afinado para ese dominio, orquestado por un agente que sabe cómo manejarlo. Es el mismo enfoque que Anthropic siguió con Claude Code para coding general: el modelo es una cosa, la infraestructura agentica es otra. La especialización en seguridad significa que los pesos se han entrenado en ejemplos de vulnerabilidades, patrones de ataque y prácticas de defensa, mientras que el agente CodeMender gestiona el ciclo de detección, corrección y verificación. Para quien trabaja en equipos de desarrollo, este patrón sugiere que la seguridad del código puede convertirse en un control continuo integrado en el ciclo de desarrollo, en lugar de un paso manual al final del pipeline. Cuán efectivo sea CodeMender en vulnerabilidades reales, comparado con herramientas SAST tradicionales o un modelo genérico instruido con el prompt correcto, queda por verificar con pruebas en tu propio código.

Google también anuncia que Gemini 3.5 Pro está en testing con partners y que el pre-entrenamiento de Gemini 4 ha comenzado. La señal es que la competencia en modelos frontier de punta continúa, mientras que la batalla diaria para quien usa IA se libra en modelos más compactos, más eficientes y especializados para tareas específicas. Quien elige un modelo hoy mira primero el costo por output verificado y la especialización en su dominio, luego la calidad general en el benchmark.

Escribe para buscar en curso, playbooks, skills, papers…