Radar · 07/08/2026 · survenu le 05/08/2026 · recherche

HarnessOpt-Bench : le premier benchmark mesure ce qui compte vraiment, l'orchestration, pas le modèle

Scale AI a publié HarnessOpt-Bench, un benchmark qui mesure la capacité des modèles frontier à optimiser la harness : l’ensemble des prompts, outils, flux de contrôle, mémoire et code d’orchestration qui entoure un modèle dans un système agentic. Le benchmark donne à un LLM la harness de départ d’un agent cible, un budget fixe d’évaluations, puis mesure le gain normalisé sur un ensemble de test qui reste inaccessible pendant la recherche.

Pourquoi cela te concerne. Comme nous l’avons mentionné le 1er août quand Manifest a fermé son routeur pour se concentrer sur l’orchestration, le goulot d’étranglement des systèmes agentiques s’est déplacé du choix du modèle vers la façon dont tu l’orchestres. HarnessOpt-Bench fournit la première métrique partagée pour mesurer justement cela. Les résultats sur 111 runs avec 5 modèles frontier montrent deux choses : les modèles optimisateurs se distinguent davantage que les harnesses qui les entourent, et utiliser la harness native du modèle ne garantit pas de meilleurs résultats.

Pour ceux qui construisent des agents, c’est la confirmation empirique d’une intuition qui devenait opérationnelle. Il y a maintenant un chiffre pour le dire. L’article sur pourquoi les agents échouent l’avait déjà montré qualitativement : presque jamais le modèle, presque toujours les étapes.

En détail

Jusqu’à aujourd’hui, les benchmarks mesuraient les modèles. SWE-bench mesure si un agent résout des problèmes GitHub réels, GAIA mesure si un assistant répond à des questions nécessitant recherche et calcul, mais personne ne mesurait systématiquement la qualité de l’armature qui entoure le modèle : les prompts, les outils, le flux de contrôle, la mémoire, le code qui orchestre tout. HarnessOpt-Bench comble ce vide.

Le setup est construit pour éviter le surapprentissage. Un modèle optimisateur, associé à une harness de codage, reçoit la harness de départ d’un agent cible, un feedback d’évaluation gradué et un budget fixe d’évaluations. Il modifie la harness, propose un candidat final et est jugé sur le gain normalisé par rapport à la harness de départ sur un ensemble de test qu’il ne peut pas voir pendant la recherche. Un environnement d’exécution contrôlé fait respecter la limite : il mesure les ressources utilisées par l’agent cible, empêche l’accès aux données de test et conserve les versions des candidats pour audit.

Les chiffres racontent deux choses. Premièrement : le choix du modèle optimisateur compte plus que la harness de codage par laquelle il agit. Sur 111 runs, les 5 modèles frontier testés se séparent clairement, tandis que les différentes harnesses produisent des résultats moins différenciés. Deuxièmement : la harness native du modèle, celle avec laquelle il a été entraîné ou que son producteur fournit par défaut, ne gagne pas de façon cohérente. L’avantage d’utiliser le même environnement que le producteur du modèle est réel sur certaines tâches mais disparaît sur d’autres.

Cela signifie que le travail d’ingénierie de la harness, celui que beaucoup font déjà à la main, a un impact mesurable et n’est pas un détail secondaire par rapport au choix du modèle de base. Si tu changes les prompts, tu ajustes le flux de contrôle, tu compactes la mémoire ou tu redéfinis les outils, tu fais exactement ce que le benchmark mesure.

Les limites sont déclarées. Les évaluations sont coûteuses et stochastiques, ce qui signifie qu’un gain mesuré peut varier entre les exécutions successives. Les 4 tâches en aval couvrent différents types de travail mais restent un échantillon réduit. Les 5 modèles frontier sont les protagonistes du moment, mais la photo vaut tant qu’il n’y a pas de nouveaux arrivants. Le paper lui-même conclut qu’il y a largement place à l’amélioration : les gains varient beaucoup selon la tâche et la harness de départ, et aucun modèle n’est bon sur tout.

Pour ceux qui construisent des agents, le message opérationnel est la suite naturelle d’une tendance que le site suit depuis des semaines. L’infrastructure au milieu, l’orchestration, la mémoire, les contrôles de qualité, comptent plus que le modèle de base. Il y a maintenant un benchmark pour le prouver avec les chiffres, et cela signifie que tu peux mesurer si une intervention sur l’architecture de l’agent apporte vraiment un gain, au lieu de te fier à l’impression ou à la démo qui fonctionne une fois sur trois.

Tapez pour chercher dans cours, playbooks, skills, papers…