Gemini 3.6 Flash costa meno, 3.5 Flash Cyber punta alla sicurezza del codice
Google annonce trois nouveaux modèles Gemini : 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber. Le premier est le modèle général, le second est le modèle économique pour les tâches rapides, le troisième est spécialisé dans la sécurité du code.
Si tu utilises des modèles Google via API ou dans ton IDE, l’annonce concrète c’est le prix. 3.6 Flash coûte $1.50 par million de tokens en entrée et $7.50 en sortie, moins que la génération précédente. Selon l’Artificial Analysis Index, il consomme 17% de tokens en moins pour la même tâche, avec des pointes de 65% en moins sur les benchmarks de coding comme DeepSWE.
3.5 Flash Cyber est la nouveauté la plus intéressante pour ceux qui travaillent en sécurité : un modèle léger entraîné pour trouver et corriger les vulnérabilités, associé à CodeMender, l’agent de sécurité du code de Google. The Verge le décrit comme une alternative économique à des modèles de sécurité plus coûteux comme Mythos d’Anthropic.
3.6 Flash est déjà disponible dans GitHub Copilot et sur Amazon Bedrock.
En détail
Ce qui change vraiment.
La série Flash de Google a toujours été le choix de ceux qui veulent la qualité à un prix accessible. 3.6 Flash met à jour cette promesse : même niveau de qualité que 3.5 Flash, mais avec moins de tokens dépensés et un coût inférieur par token. Pour ceux qui exécutent des agents en production, où une tâche peut nécessiter des dizaines d’appels au modèle, la différence s’accumule rapidement.
Les chiffres doivent être lus avec prudence. Le chiffre de réduction de 17% des tokens vient de l’Artificial Analysis Index, un benchmark indépendant. Le chiffre de 65% sur DeepSWE provient de Google lui-même et fait référence à un benchmark spécifique de coding. L’économie réelle dépendra de ton cas d’usage.
Flash Cyber et le pattern modèle + agent.
3.5 Flash Cyber est le signal le plus intéressant de l’annonce, non pas pour le modèle en soi mais pour la façon dont il est présenté. Google ne le lance pas comme un modèle isolé : ils l’associent à CodeMender, un agent qui orchestre les appels au modèle pour scanner le code, trouver les vulnérabilités et proposer des patches. C’est le même pattern que nous avons vu fonctionner ailleurs : un modèle spécialisé gouverné par une infrastructure agent qui décide quand l’appeler, avec quels contextes et comment vérifier le résultat.
La manœuvre est dirigée contre Mythos d’Anthropic, le modèle de sécurité que The Verge décrit comme plus coûteux. Google positionne Flash Cyber comme une alternative accessible pour ceux qui n’ont pas le budget pour les modèles frontier.
Ce que nous ne savons pas encore.
Google n’a pas publié de benchmarks indépendants sur Flash Cyber. Il n’est pas clair quels ensembles de données de vulnérabilités ont été utilisés pour l’entraînement, ni quelle est l’ampleur de la couverture par rapport à un modèle généraliste utilisé avec un bon prompt de sécurité. La comparaison avec Mythos est déclaratoire : tant qu’il n’y a pas de tests comparatifs, cela reste une affirmation marketing.
La disponibilité de Flash Cyber est limitée à l’écosystème Google (API Gemini, Vertex AI). Si ton infrastructure fonctionne sur autre chose, pour l’instant ce n’est pas accessible.
Les deux autres modèles.
3.5 Flash-Lite est le modèle le plus rapide de la série : 350 tokens par seconde, selon l’Artificial Analysis Index. Pour les tâches où la latence compte plus que la qualité (classification, extraction de données, routage), c’est une option concrète.
Google annonce aussi que Gemini 3.5 Pro est en test avec des partenaires et que Gemini 4 a commencé le pré-entraînement. Aucune date pour aucun des deux.