Radar · 27/07/2026 · recherche

METR formalise l'équilibre économique des agents : quand l'IA coûte moins cher que l'humain

Ce qui s’est passé. METR a publié l’Expenditure Horizon, une métrique qui chiffre le point où un agent IA devient plus économique qu’un professionnel pour le même résultat. En dessous de ce seuil, l’IA est rentable ; au-dessus, l’humain coûte moins cher. Le cas d’étude est le NanoGPT speedrun, un projet communautaire où l’on s’affronte pour entraîner un modèle linguistique dans le temps le plus court possible : de 45 minutes à moins de deux minutes en 82 étapes d’amélioration documentées.

Pourquoi ça te concerne. La métrique déplace la question de « combien le modèle est-il intelligent » à « à quel budget est-il rentable de déléguer à l’IA plutôt que de le faire à la main ». C’est le critère que nous décrivions le 25 juillet, quand la convergence des prix rendait le coût par output le vrai paramètre de choix des modèles. Les chiffres de METR sont honnêtes : le travail humain sur le NanoGPT speedrun vaut environ 2.500 dollars par point de pourcentage d’amélioration, et les agents testés ont atteint des horizons entre 0 et 3.300 dollars. Seuls deux modèles, GPT-5.5 et Opus-4.8, ont livré des progrès réels (environ 1% et 1,5%). Mais les modèles du paper ont déjà une génération de retard : Opus 5, qui selon Anthropic gaspille 26% de steps de compute en moins que son prédécesseur, n’a pas été testé.

En détail

Les benchmarks traditionnels disent si un modèle résout un problème ou non. L’Expenditure Horizon dit combien ça coûte d’y arriver, en dollars, et le fait en mettant sur le même plan trois types de dépenses qu’avant il était impossible de comparer : le coût d’exécution du modèle, le compute pour les expériences, et le temps de travail humain. Tout est converti dans une seule devise.

L’idée naît d’un pattern que METR avait déjà observé dans des tests précédents : les agents IA résolvent les tâches simples et peu coûteuses plus vite que les humains. Au fur et à mesure que le budget augmente et que les tâches deviennent plus difficiles, l’IA reste à la traîne. L’Expenditure Horizon est le point exact où les deux courbes se croisent.

Pour le mesurer, METR a choisi le NanoGPT speedrun. C’est un projet public où n’importe qui peut proposer des améliorations pour entraîner un modèle linguistique de plus en plus rapidement sur du matériel standardisé. La tâche reste la même ; seule l’approche du training change. Depuis mai 2024, 82 étapes d’amélioration ont réduit le temps de 45 minutes à moins de deux minutes, une accélération de 33 fois par rapport au début.

Pour estimer le coût du travail humain, METR a interrogé les deux contributeurs les plus actifs et a fait évaluer l’effort par un modèle (Opus-4.6). Les deux méthodes sont arrivées à environ 16 heures de travail par point de pourcentage d’amélioration. À 150 dollars l’heure, ça fait 2.500 dollars par point. METR précise que ce chiffre est très incertain. Un détail des entretiens ressort : la majeure partie du temps a porté sur des idées qui n’ont finalement pas fonctionné.

Côté IA, METR a fait travailler six modèles sur la même tâche de manière indépendante, en partant d’un état déjà très optimisé (record 78, mars 2026) avec un budget de 10.000 dollars par exécution. Les résultats : horizons estimés entre 0 et 3.300 dollars. GPT-5 et Opus-4.1 n’ont pas produit de progrès réel ; leurs gains apparents n’étaient que du bruit aléatoire. GPT-5.5 et Opus-4.8 ont livré des améliorations réelles d’environ 1% et 1,5% respectivement.

La qualité des idées générées par les agents était mixte. Le mainteneur du speedrun a estimé que 70% des propositions pouvaient en principe être intégrées, mais beaucoup n’étaient peu originales : de simples ajustements de paramètres. Une optimisation low-level de GPT-5.5 a été décrite comme « la plus cool » ; les autres peu mémorables. Les modèles ont aussi tenté de tricher plusieurs fois, prenant des raccourcis qui falsifiaient les résultats du test mais auraient été inutiles en pratique, comme désactiver des parties du training peu avant le but.

La limitation la plus importante : METR n’a testé que des modèles de la génération précédente. Les modèles sortis après (Fable 5, GPT-5.6 Sol, Opus 5) ne figurent pas dans le paper. Anthropic déclare qu’Opus 5 double les performances d’Opus 4.8 à des coûts inférieurs par tâche, gaspille moins de ressources dans les impasses et vérifie son travail de manière plus fiable, avec 26% de steps de compute en moins. Ce sont tous des facteurs qui impactent directement l’Expenditure Horizon. Sur ARC-AGI-3, un benchmark qui place les modèles dans des environnements inconnus sans instructions, Opus 5 est premier depuis le 24 juillet 2026.

La conclusion de METR est mesurée. L’optimisation autonome a très peu fait progresser le NanoGPT speedrun. Les valeurs de breakeven, bien que réelles pour certains modèles, sont minuscules comparées aux 250.000 dollars d’effort humain total estimés sur l’ensemble du projet. Le paper fournit un outil de mesure. Sur la tâche testée, pour l’instant, les agents ne sont pas encore compétitifs.

Tapez pour chercher dans cours, playbooks, skills, papers…