Radar · 17/07/2026 · survenu le 16/07/2026 · modèles

Quatre modèles en confrontation sur les clips musicaux : quand le benchmark devient utilisable

TryAI a construit un harness agentique qui fournit à un modèle une chanson, un budget en dollars et six outils (recherche web, génération d’images/vidéos, ffmpeg local), puis le laisse travailler seul jusqu’à la vidéo finie. Ils l’ont exécuté sur quatre modèles — Claude Fable 5, GPT-5.6 Sol, Grok 4.5 et le nouveau Muse Spark de Meta — avec deux budgets chacun ($25 et $100), sur la même chanson (Uptown Funk).

Les quatre ont produit une vidéo complète. Claude Fable 5 à $100 a généré 80 clips (le nombre le plus élevé) en dépensant $48.60 et a choisi un seul modèle vidéo (Seedance 1.0 Pro). GPT-5.6 Sol à $100 en a généré 70, en dépensant $36.57, et a mixé trois modèles vidéo différents en un seul run. À $25 Sol a utilisé une architecture image-puis-vidéo, les autres sont allés directement du texte à la vidéo.

Les logs complets de chaque run — chaque plan, chaque appel d’outil, chaque erreur — sont sur GitHub. La différence avec un benchmark classique : ici tu vois la vidéo que chaque modèle a produite, tu lis comment il a travaillé et combien il a dépensé, et tu décides toi-même quelle approche tu préfères. Il n’y a pas de score final : il y a le matériel pour juger.

En détail

L’architecture du test.

Le système fournit au modèle six outils :

  • plan : pour réfléchir sans coûts ni actions.
  • web_search : pour chercher quels modèles de génération existent, lire les API et se documenter sur les vidéos musicales.
  • get_budget : pour savoir combien il reste.
  • generate_image et generate_video : les deux seuls qui consomment le budget, avec accès à FAL et Replicate. Le modèle choisit quel modèle sous-jacent appeler et avec quels paramètres.
  • run_command : un shell local avec ffmpeg/ffprobe, pour couper, concaténer des clips et muxer l’audio final.

Une fois le budget épuisé, les appels payants sont refusés, mais le modèle peut continuer à éditer. Chaque message, appel d’outil, facturation et erreur finissent dans le log.

Les chiffres en détail.

À $25, les deux modèles ont presque épuisé le budget : Claude Fable 5 a dépensé $24.30, GPT-5.6 Sol $23.18. À $100 l’histoire diverge : GPT-5.6 Sol s’est arrêté à $36.57, Claude Fable 5 a atteint $48.60. Plus de budget a signifié plus de séquences pour les deux.

Le coût total inclut aussi les tokens du modèle, qui pour Claude Fable 5 ($10/$50 par million input/output) a ajouté entre $16.99 et $25.05 par run, environ 30-40% du total. GPT-5.6 Sol ($5/$30) est resté sous les $5 de tokens grâce au prompt caching.

Les appels échoués (principalement des erreurs réseau transitoires chez les fournisseurs) n’ont pas été facturés, mais le modèle a dépensé des étapes pour les réessayer : de zéro (Fable 5 à $100) à dix (Sol à $25).

Les choix architecturaux.

Trois runs sur quatre sont allés en text-to-video pur. Seul GPT-5.6 Sol à $25 a utilisé une architecture différente : il a d’abord généré des keyframes avec FLUX schnell ($0.003 par image), puis les a animés avec Wan 2.2-5b image-to-video ($0.10 par seconde).

GPT-5.6 Sol à $100 a mixé trois modèles vidéo dans le même run : Wan 2.5 ($0.05/s), Veo 3.1 Lite ($0.10/s) et Hailuo 2.3 Standard (~$0.28 par clip de 6 secondes). Claude Fable 5 à $100 a choisi un seul modèle (Seedance 1.0 Pro, ~$0.12/s à 1080p) et a généré le plus grand nombre de clips distincts (80).

Les prix cités sont ceux listés par FAL, qui peuvent diverger des tarifs officiels des fournisseurs.

Pourquoi c’est important.

Ce test anticipe une guerre de performances et de prix dans les outils de génération multimodale. Ce n’est pas un benchmark académique : c’est une confrontation exécutable, avec des résultats visibles et des coûts mesurés. N’importe qui peut cloner le repo et le refaire sur ses propres prompts.

Pour qui développe ou évalue des agents, le dataset ici est le code lui-même : l’harness, les logs, les vidéos finales. C’est le type d’évaluation qui manque dans les communiqués : transparent, reproductible, et avec l’output final que tu peux juger toi-même.

La limite : un seul cas (une chanson), quatre modèles, une architecture fixe. Ce n’est pas une évaluation générale, mais un exemple de comment bien évaluer : avec du matériel vérifiable et des critères déclarés d’avance.

Tapez pour chercher dans cours, playbooks, skills, papers…