Radar · 23/07/2026 · modèles

Laguna S 2.1 : 118B open-weight qui bat Claude Fable 5 et coûte moins que DeepSeek v4 Flash

Poolside AI déploie Laguna S 2.1, un modèle open-weight de 118 milliards de paramètres totaux avec architecture MoE (8B actifs par token), qui surpasse Claude Fable 5 sur les benchmarks et coûte moins que DeepSeek v4 Flash. Fenêtre de contexte jusqu’à 1 million de tokens, avec modes thinking et no-thinking.

Pourquoi cela te concerne. Une équipe de moins de 70 chercheurs produit un modèle qui surpasse des modèles frontier dix fois plus grands. Comme on l’expliquait le 20 juillet avec Qwen 3.8, l’écart entre modèles ouverts et modèles propriétaires se referme : le choix entre les deux devient économique, pas technique. Kimi K3, Qwen 3.8 et maintenant Laguna S 2.1 convergent vers le même signal : la compression de la qualité est une tendance, pas un cas isolé.

Pour qui utilise l’IA dans son travail, le coût d’une API open-weight n’est plus le prix d’un modèle faible. Tu peux payer moins et obtenir des résultats comparables aux frontier sur beaucoup de tâches. Le calcul change, et il vaut la peine de le refaire sur tes données plutôt que de rester bloqué sur les classements de juillet.

En détail

Poolside AI est un neolab fondé par Eiso Kant, qui a passé quatre ans et 12 millions de dollars à construire des modèles pour le code avant que le marché s’en aperçoive. Aujourd’hui l’équipe compte moins de 70 chercheurs mais a construit ce que Kant appelle la « Model Factory » : un système end-to-end qui amène un modèle du pre-training au déploiement en huit semaines, avec 10 000-20 000 expériences par mois.

Laguna S 2.1 est une Mixture-of-Experts : 118 milliards de paramètres totaux, mais seulement 8 milliards actifs à chaque token généré. C’est comme avoir une équipe de spécialistes où pour chaque question seul l’expert compétent répond, au lieu de mobiliser tout le département. Cela maintient bas le coût d’inférence tout en ayant une capacité globale élevée. La fenêtre de contexte atteint 1 million de tokens et le modèle offre des modes thinking (réfléchir avant de répondre) et no-thinking (répondre direct).

Sur les benchmarks, Laguna S 2.1 surpasse Claude Fable 5 et le modèle de Thinking Machines (Inkling, 975B paramètres déployé le 17 juillet), avec un modèle presque dix fois plus petit. Il coûte moins que DeepSeek v4 Flash et surpasse DeepSeek v4 Pro en qualité.

Le contexte compte. Le 17 juillet Moonshot AI avait déployé Kimi K3, 2.8T paramètres, le plus grand modèle open-weight jamais publié. Trois jours après Alibaba avait mis en preview Qwen 3.8, 2.4T paramètres. Les deux montraient que la qualité des modèles ouverts se rapprochait des frontier. Poolside ajoute une troisième donnée : tu n’as pas même besoin d’être énorme. Un 118B MoE bien entraîné, avec la bonne pipeline d’expériences, suffit.

Le point intéressant de la stratégie Poolside est l’accent sur la persistance, la vérification et le backtracking. Kant soutient que la capacité à essayer, vérifier et corriger compte plus que l’intelligence brute. C’est la même direction qu’on voit dans les agents de coding, où l’architecture de la boucle de contrôle gagne sur la puissance du modèle unique.

Les limites de ce qu’on sait aujourd’hui. Les benchmarks cités viennent du tech report de Poolside et de la couverture de Latent.Space du 23 juillet, pas d’évaluations indépendantes vérifiées. Le modèle est open-weight mais on n’a pas encore de données d’adoption ou de tests sur des tâches réelles hors du coding. Poolside a levé 500 millions de dollars, donc a les ressources pour soutenir la recherche, mais le panorama des modèles ouverts bouge si vite qu’un avantage aujourd’hui peut durer des semaines.

Pour qui construit des produits sur un modèle unique, la question change. Aujourd’hui la vraie question est quelle combinaison de qualité, coût et licence te permet de dormir tranquille. Un MoE 118B avec 8B actifs coûte peu à chaque appel, et si les poids sont ouverts tu peux aussi le self-hostter. Le point faible reste la vérification : tant que les chiffres viennent du labo qui a construit le modèle, le conseil reste de le tester sur tes propres tâches avant de croire aux classements.

Tapez pour chercher dans cours, playbooks, skills, papers…