Radar · 07/08/2026 · survenu le 06/08/2026 · modèles

Qwen3.8 Max en tête de l'agentic index : le frontier chinois open-weight rivalise sur l'orchestration

Qwen3.8 Max a atteint la première place de l’agentic index d’Artificial Analysis, aux côtés de GPT-5.6 Sol sur les tâches d’orchestration. Le modèle open-weight 2.4T d’Alibaba rivalise sur le terrain qui compte le plus pour qui construit des agents : les tâches multi-étapes avec outils, pas la conversation.

Il y a deux jours, nous parlions de Qwen3.8-Max pour les signaux de production, quand Alibaba ouvrait les poids et OpenAI documentait la valeur de Circles en télécommunications. Maintenant le frontier chinois passe un autre examen, et il le passe là où le chat ne suffit pas.

L’agentic index v4.1.1 pèse neuf évaluations qui vont au-delà de la réponse unique : automatisation bancaire, codage au terminal, reasoning sur des examens difficiles. Ce sont des tâches où le modèle planifie, appelle des outils, récupère du contexte sur des séquences longues. Le classement place Qwen3.8 Max comme meilleur modèle global sur cette combinaison.

Pour qui scale des agents, la conséquence est concrète. Si un modèle open-weight égale le frontier propriétaire sur l’orchestration, le choix du modèle de base cesse d’être la contrainte principale. Coût par tâche, latence et gouvernance des données deviennent les vrais critères. Un frontier avec poids téléchargeables change l’équation pour qui doit décider ce qui tourne dans son stack, et jusqu’où il peut le contrôler.

En détail

L’agentic index d’Artificial Analysis est l’une des références pour qui évalue des modèles sur le travail agentic plutôt que sur la conversation. La version 4.1.1 pèse neuf évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. Les noms sont techniques, mais le pattern est clair. Ce sont des tâches où le modèle combine plusieurs étapes, utilise des outils et maintient la cohérence sur des séquences qui s’allongent. Rien sur des questions à réponse unique.

Qwen3.8 Max en tête de ce classement signifie que le modèle 2.4T paramètres d’Alibaba, dont les poids sont téléchargeables depuis quelques jours, tient le rythme du frontier propriétaire d’OpenAI sur le travail qui coûte le plus en production. L’article du 3 août racontait l’arrivée de Qwen3.8-Max dans les stacks USA comme second géant chinois après Kimi K3. Maintenant il y a une mesure indépendante qui dit : le modèle est à la fois disponible et compétitif sur la tâche lourde.

Le point pour qui décide est pratique. Jusqu’à hier le frontier propriétaire, GPT-5.6 ou Claude Opus 5, était le choix obligatoire pour les tâches agentiques complexes. Le modèle open servait pour les coûts bas ou la privacy, mais cédait sur la qualité quand la tâche demandait planification et utilisation d’outils sur plusieurs tours. Si l’écart sur l’agentic index se ferme, la décision se déplace sur des facteurs qui venaient avant : combien coûte chaque tâche, combien de temps pour répondre, où tournent les poids, qui voit les logs. Le modèle de base devient une variable parmi tant d’autres.

Pense à un agent qui lit la boîte mail, classe les messages et produit un rapport matinal. Si le modèle open-weight tient l’orchestration comme le frontier, tu peux faire tourner les poids en local ou chez un provider économique sans perdre de qualité sur le passage critique. L’économie se voit sur le coût par tâche, pas sur le score.

Restent les limites. Un benchmark agentic mesure les performances sur des tâches standardisées, avec des données propres et des objectifs stables. La production est rarement ainsi. Les utilisateurs changent d’avis à mi-chemin, les données sont sales, le contexte s’allonge au-delà de la fenêtre. Les modèles qui brillent sur les benchmarks peuvent peiner là où le cas réel diverge du test.

Il y a ensuite le versant géopolitique. L’administration USA évalue des interdictions ciblées sur des modèles chinois ouverts individuels, et un modèle chinois en tête d’un classement agentic accélère cette conversation. Pour qui utilise le modèle aujourd’hui, la question pratique est si les poids resteront accessibles demain.

Ce qui manque au classement c’est le coût par tâche. Artificial Analysis le publie à côté de l’indice d’intelligence, mais le positionnement en tête ne dit pas automatiquement que Qwen3.8 Max soit aussi le choix le plus économique. Avant de déplacer la production sur un modèle nouveau, il vaut mieux se construire un banc de test avec tes propres cas et comparer coût, latence et qualité sur le vrai travail.

Tapez pour chercher dans cours, playbooks, skills, papers…