Radar · 01/08/2026 · survenu le 31/07/2026 · modèles

DeepSeek V4-Flash égale GPT-5.6 Luna à un coût par tâche inférieur de 60%

DeepSeek a lancé V4-Flash-0731, la mise à jour de son modèle ouvert doté de 284 milliards de paramètres totaux et 13 milliards actifs (MoE), avec un contexte de 1 million de tokens. Sur l’Intelligence Index d’Artificial Analysis, le modèle passe de 40 à 50 points, un point derrière GPT-5.6 Luna, à un coût par tâche inférieur de 60%. Les poids sont ouverts sous licence MIT, disponibles immédiatement sur Hugging Face.

Le saut de performances provient entièrement du post-training, sans changements d’architecture ou de taille : Terminal-Bench passe de 56.9 à 82.7, et l’utilisation de tokens en sortie baisse de 12% par rapport au prédécesseur. Le prix de l’API est de 0,14 dollar par million de tokens en entrée et 0,28 en sortie, avec une réduction de 98% sur les tokens en cache (0,0028 dollar par million).

Pour ceux qui construisent des agents, le calcul change rapidement. Le même jour où OpenAI réduit de 80% le prix de GPT-5.6 Luna, DeepSeek offre des performances quasi équivalentes à une fraction du coût, avec des poids téléchargeables. Le compromis entre modèle performant et modèle économique, qui s’était réduit hier, se complique aujourd’hui : un troisième contendeur ouvert émerge.

Si vous voulez l’essayer : le modèle est disponible sur OpenRouter en tant que deepseek/deepseek-v4-flash-0731. Le niveau de reasoning par défaut laisse à désirer sur certaines tâches ; le passer à « high » modifie les résultats de manière visible.

En détail

Où nous en étions.

Jusqu’à hier, la guerre des prix entre modèles frontière se jouait sur deux fronts : OpenAI d’un côté, Anthropic et Google de l’autre. Les modèles ouverts chinois (Kimi K3, Qwen 3.8) avaient comblé l’écart technique, mais restaient en retrait sur les tâches complexes d’agentique. V4-Flash dans sa version d’avril marquait 56.9 sur Terminal-Bench et 40 points sur l’Intelligence Index : utile, mais pas un substitut de la frontière.

Ce qui change avec la mise à jour 0731.

Le saut provient entièrement du post-training. DeepSeek n’a pas modifié l’architecture ou la taille : mêmes 284 milliards de paramètres totaux, mêmes 13 milliards actifs par token (256 experts, 6 actifs). Ce qui a changé, c’est la qualité de l’entraînement post-supervisé, notamment sur les tâches d’agentique comme l’utilisation d’outils, la planification multi-étapes et le reasoning long.

Les chiffres clés, mesurés par Artificial Analysis le 31 juillet 2026 :

  • Intelligence Index : 40 → 50 (GPT-5.6 Luna est à 51)
  • Terminal-Bench : 56.9 → 82.7
  • GDPval-AA v2 Elo : 1189 → 1559
  • Tokens en sortie : -12% par rapport au prédécesseur

Le prix de l’API dès la première partie est agressif : 0,14 dollar par million de tokens en entrée, 0,28 en sortie. La réduction sur les tokens en cache est de 98% (0,0028 dollar par million), un niveau qui modifie le coût réel quand un agent travaille sur un contexte long et stable.

Détails techniques pour les non-ingénieurs.

V4-Flash est un Mixture of Experts : 284 milliards de paramètres distribués sur 256 experts, mais pour chaque token généré n’en active que 6. C’est comme avoir une équipe de 256 spécialistes et en appeler 6 pour chaque question. Cela maintient les coûts d’inférence bas tout en conservant une capacité totale comparable à des modèles beaucoup plus grands. Le modèle supporte trois niveaux d’effort de reasoning et inclut un module de speculative decoding qui s’active avec un flag.

Les poids ouverts, et pourquoi ça compte.

Les poids ont été publiés sous licence MIT le même jour que l’API. Vous pouvez télécharger le modèle, l’héberger sur vos serveurs, le modifier. Vous n’êtes pas lié à l’API de DeepSeek. Les versions quantifiées pour utilisation locale tournent avec 168 GB de RAM pour le 4-bit et 110 GB pour le 3-bit.

Cela se produit tandis que la Maison Blanche évalue des interdictions ciblées sur les modèles open-weight chinois et que les labs propriétaires font front commun sur les risques des poids ouverts. Pour ceux qui construisent sur des modèles ouverts, la disponibilité d’un modèle compétitif sous MIT est un fait concret : plus de fournisseurs l’offrent, plus l’infrastructure est redondante.

Limitations.

Le modèle est text-only : pas de vision, pas d’audio. Le saut de performances est mesuré sur les benchmarks d’Artificial Analysis et par la communauté, pas par une évaluation indépendante tierce. Le niveau de reasoning par défaut produit des résultats décevants sur certaines tâches : il faut le passer à « high » pour obtenir le meilleur, ce qui augmente le coût et la latence. C’est une bêta publique : le comportement peut changer.

Tapez pour chercher dans cours, playbooks, skills, papers…