Kimi K3 : 2,8T paramètres, le plus grand modèle open-weight jamais publié, les prix chinois augmentent
Moonshot AI a publié Kimi K3, un modèle MoE avec 2,8 trillions de paramètres totaux et 50 milliards actifs, le plus grand modèle open-weight jamais publié. La licence Apache 2.0 le rend disponible pour l’auto-hébergement et l’usage commercial. Lors des premiers tests indépendants de sa robustesse face aux prompt injections, le modèle a répondu de manière directe «Is there something I can actually help you with today?» au lieu de céder.
Les performances annoncées le positionnent au niveau de GPT-5.6 Sol et Claude Fable 5 sur SWE-bench et les tâches de codage complexes, et les prix API ne sont plus des prix de sacrifice : l’entrée coûte autant que le top tier de Meta (Muse Spark), la sortie le double. C’est un signal : la Chine sort du segment des modèles à prix de dumping et compete sur la valeur, pas seulement sur le coût.
Pourquoi ça te concerne. Si tu travailles avec des modèles auto-hébergés, K3 est le premier modèle ouvert avec des performances frontier que tu peux faire tourner sur ton infrastructure. Si tu utilises des API, les prix signalent que le marché chinois commence à se positionner comme une alternative sérieuse aux labs américains, plus seulement comme fournisseur de masse à bas coût. Les choix techniques (architecture MoE, contexte long) reprennent ceux des modèles propriétaires les plus récents, et la publication Apache renforce la pression compétitive sur les autres labs pour qu’ils libèrent leurs poids.
En détail
Le contexte.
Jusqu’à aujourd’hui, les modèles open-weight au-delà du trillion de paramètres étaient des expériences de recherche (Grok 1, publié par xAI en mars 2024, en avait 314 milliards) ou des variantes distillées de modèles plus grands. K3 est le premier modèle de cette échelle publié comme produit complet avec licence permissive.
Moonshot AI est la société derrière l’assistant Kimi, populaire en Chine pour sa fenêtre de contexte longue (initialement 200k tokens, puis étendue). K3 est la troisième génération de la famille, après K1 (2023) et K2 (début 2025). Le nom du modèle suit la convention interne de l’entreprise.
Les chiffres annoncés.
K3 utilise une architecture Mixture of Experts (MoE) : 2,8T paramètres totaux, mais seulement 50B actifs en inférence. Cela réduit les besoins en mémoire et latence par rapport à un modèle dense de la même capacité nominale. Le contexte natif est 1M tokens, en ligne avec les modèles frontier récents (Gemini 2.5, GPT-5.6).
Les benchmarks annoncés par Moonshot placent K3 au-dessus de Claude Opus 4.8 sur AIME (mathématiques) et au même niveau que GPT-5.6 Sol sur SWE-bench Verified (codage en conditions réelles). Il n’y a pas encore d’évaluations indépendantes à grande échelle, mais les premiers tests de la communauté confirment que le modèle ne s’effondre pas sur les tâches complexes.
Les prix API sont $1,50/million de tokens en entrée et $6/million en sortie (données vérifiées sur le pricing officiel au 17 juillet 2026). Pour comparaison : GPT-5.6 Sol coûte $3/$15, Claude Fable 5 $3/$15, Muse Spark 1.1 $1,50/$3. K3 se positionne au milieu : entrée comme Meta, sortie le double. Ce n’est plus le prix chinois que tous connaissaient (DeepSeek v3 était à $0,14/$0,28), mais un prix de modèle haut de gamme.
Ce qui change.
Premièrement, l’écart qualitatif se réduit. Les modèles chinois ne sont plus « presque aussi bons que » les frontier américains : sur certaines tâches ils les égalent, et le font avec des licences ouvertes. Cela change le calcul pour qui choisit un modèle : si K3 tient sur ton cas d’usage, tu as une alternative auto-hébergée qui ne dépend pas d’une API étrangère.
Deuxièmement, la guerre des prix change de registre. La Chine a utilisé pendant des années le prix comme levier compétitif (modèles ouverts quasi gratuits en API). K3 signale qu’au moins Moonshot vise maintenant de compétitionner sur la qualité perçue, pas sur le dumping. Si d’autres labs chinois suivent, le marché global se rééquilibre : moins de course au rabais, plus de différenciation sur les performances et les licences.
Troisièmement, la pression sur les autres labs. Anthropic et OpenAI gardent les poids fermés ; Meta publie des poids ouverts mais plus petits (Llama 4 s’arrête à 405B denses, Muse Spark à ~600B MoE). Un modèle ouvert de 2,8T paramètres, Apache, qui performe comme leurs top tiers, est un argument difficile à ignorer pour qui demande de la transparence.
Les limites.
Il n’y a pas encore d’évaluations indépendantes à large échelle : les benchmarks de Moonshot sont auto-rapportés. La communauté teste le modèle, mais il faudra des semaines pour obtenir un consensus sur ce qui marche bien et ce qui ne marche pas. Le modèle n’est pas multimodal (texte seulement), contrairement à GPT-5.6 et Gemini 2.5.
Les besoins d’auto-hébergement restent élevés même avec MoE : 50B actifs demandent au minimum une machine avec 4×A100 ou H100 pour une inférence fluide, et le coût de mise en place n’est pas négligeable pour qui n’a pas déjà l’infrastructure. L’API est la voie pratique pour la majorité des usages.
Enfin, l’écosystème : les outils et intégrations pour K3 sont encore jeunes comparés à ceux pour GPT ou Claude. Si ton workflow s’appuie sur des outils bien éprouvés, passer à un modèle nouveau demande du travail d’adaptation.