GPT-5.6, Grok 4.5, Claude et Muse Spark sur le même banc d'essai
TryAI a mis douze modèles en compétition sur quatre tâches de coding : un raycaster 3D façon Doom, un cube de Rubik avec animations, une calculatrice et le Jeu de la Vie de Conway. Chaque modèle a eu cinq tentatives par tâche, avec les coûts et les temps enregistrés.
Pourquoi ça te concerne. Quand tu dois choisir l’outil pour une vraie tâche, les benchmarks abstraits ne suffisent pas : il faut des exemples concrets sur des cas réalistes. Ce test montre que GPT-5.6 Sol est le plus fiable sur le raycaster (5/5 tentatives réussies), Claude Fable 5 ne rate pas un coup sur le cube de Rubik (5/5), et Grok 4.5 est un choix solide à un quart du prix. Muse Spark 1.1 surprend quand ça marche, mais rate trois tentatives sur cinq. Les modèles open-weight (Qwen, DeepSeek, Kimi, GLM) coûtent moins cher mais sont moins fiables : bons pour expérimenter, risqués pour la production.
Si tu veux l’essayer. Le site publie chaque tentative (vingt par modèle) : tu peux les exécuter dans le navigateur et voir où ils cassent. C’est le moyen le plus direct de comprendre si un modèle tient le coup pour ton type de tâche avant de payer une clé.
En détail
Les tests précédents de TryAI avaient été critiqués sur Hacker News pour avoir donné à chaque modèle un seul tentative. Cette fois, ils ont répondu avec rigueur : douze modèles, quatre apps, cinq tentatives chacun, avec les coûts et la latence mesurés à chaque tour.
Les modèles testés
L’alignement inclut les trois variantes de GPT-5.6 (Sol, Terra, Luna), Grok 4.5, GPT-5.5, Claude Opus 4.8 et Claude Fable 5, Muse Spark 1.1 de Meta, et quatre modèles open-weight : Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6 et GLM-5.2, tous servis via Fireworks.
Tâche 1 : raycaster 3D
Un labyrinthe en première personne avec mouvements WASD, profondeur des murs, sol et plafond. GPT-5.6 Sol réussit cinq tentatives sur cinq, avec plus de détail dans les résultats que GPT-5.5. Grok 4.5 fait 5/5 à 27 centimes pour cinq runs, un quart du coût de Sol. Claude Opus 4.8 ne fait que 4/5, moins fiable que prévu. Muse Spark 1.1 surprend : seulement deux tentatives réussies, mais celles qui marchaient rivalisaient avec Fable et Sol.
Tâche 2 : cube de Rubik
Un cube 3D coloré avec boutons Scramble et Solve qui animent les rotations. Claude Fable 5 ne rate pas : 5/5, aucun bug, animations fluides. GPT-5.6 Sol fait 4/5 (une tentative a produit un cube complètement noir, un choix intéressant). GPT-5.6 Luna s’effondre : 0/5, le cube se cassait au premier mélange. Claude Opus 4.8 n’a pas réussi une seule tentative parfaite, un résultat inattendu vu que Fable 5 a fait cinq sur cinq.
Tâches 3 et 4 : calculatrice et Jeu de la Vie
Les détails complets sont sur le site de TryAI, avec chaque tentative exécutable dans la page. La calculatrice exigeait la bonne priorité des opérateurs ; le Jeu de la Vie devait animer les générations avec des contrôles play/pause.
Implications pratiques
Les résultats varient beaucoup entre tentatives du même modèle sur la même tâche : c’est pourquoi un seul tentative ne suffit pas à juger. GPT-5.6 Sol coûte plus cher mais rate moins ; Grok 4.5 est un choix économique solide ; Claude Fable 5 excelle où la précision visuelle compte. Les modèles open-weight (Qwen, DeepSeek) coûtent peu mais la variance entre tentatives est élevée : bons pour expérimenter, risqués où la fiabilité est essentielle.
Les limites du test
Quatre tâches ne sont pas un benchmark complet, et l’évaluation (« playable », « clean solve ») est subjective. TryAI le déclare ouvertement : ce n’est pas un verdict scientifique, c’est un échantillon réel publié en intégralité. La valeur réside dans les liens aux vraies tentatives : tu peux les exécuter et te forger ta propre opinion.
Comme nous l’expliquions le 5 juillet, les benchmarks génériques ne te disent pas si un modèle fonctionne pour toi : il faut un banc d’essai avec tes propres cas. Ce test t’en donne quatre concrets, cinq tentatives par modèle, et les liens pour les exécuter : c’est le point de départ pour décider avant de payer.