Radar · 07/08/2026 · survenu le 06/08/2026 · modèles

Muse Spark 1.2 de Meta atteint la frontière à 0,69 dollar par test : le prix devient critère compétitif

Muse Spark 1.2, la mise à jour du modèle de coding que Meta a lancée en juillet, entre dans le top 5 du Vals Index à 0,69 dollar par test. Trois fois moins cher que Kimi, dix fois moins que Claude Opus, Fable et GPT-5.6 Sol. C’est aussi le premier modèle au-dessus de 60% sur Finance Agent v2, à 0,77 dollar contre les 5,12 d’Opus 5.

Meta annonce des résultats de médaille d’or dans cinq olympiades STEM, avec des scores parfaits dans les épreuves théoriques de physique. Elle les a obtenus avec du raisonnement pur et de l’orchestration multi-agent en parallèle, sans appeler d’outils externes.

Pour qui utilise l’IA dans son travail, le signal compte plus que les chiffres isolés. Le prix par tâche correcte est en train de devenir le discriminant entre les modèles de frontière. Quand les performances sont similaires, c’est le coût qui décide. C’est le même fil conducteur que nous avons vu avec DeepSeek V4-Flash et avec la réduction de 80% du prix de Luna.

Meta propose aussi une version « contributor » à 0,10 dollar par million de tokens en input et 0,20 en output, si tu acceptes que tes données servent à entraîner leurs modèles. La version standard coûte 1,25/4,25.

En détail

Ce qu’il y avait avant. Meta est arrivée tard dans la course aux coding agents. Muse Spark 1.1, en juillet, avait des prix agressifs mais des performances encore sous la gamme frontière. Le saut de 1.2 vient de l’augmentation du training sur coding : Meta a intensifié le compute sur les tâches de codification, a diversifié les environnements d’entraînement et a co-entraîné le modèle avec Muse Code, son coding agent propriétaire. L’idée est que le modèle donne le meilleur de lui-même quand il est associé à son interface spécifique.

Les chiffres sur le Vals Index. 1.2 passe de « hors classement » à top 5 à 0,69 dollar par test. Sur Finance Agent v2, c’est le premier au-dessus de 60% de précision à 0,77 dollar par tentative, contre les 5,12 d’Opus 5, et à vitesse double. Artificial Analysis a enregistré l’un des plus grands sauts de score pour 1.2 après la mise à jour des critères d’évaluation (patch v4.1.1). Quelle part du saut soit réelle et quelle part vienne de la notation modifiée reste à clarifier, mais le pattern est cohérent entre deux benchmarks indépendants.

Les olympiades sans outils. Meta a participé à cinq olympiades STEM (physique, mathématiques, chimie, raisonnement mathématique) en obtenant un niveau de médaille d’or dans toutes, trois d’entre elles sous conditions de compétition officielles avec évaluation officielle. Le détail qui a alimenté le débat est le « no tools » : pas de search, pas de code, pas de calculatrice. Que du raisonnement, avec orchestration multi-agent en parallèle. François Chollet et d’autres ont discuté de la part du résultat qui revient au modèle et de celle qui revient à l’infrastructure. La question de fond, qui revient chaque fois qu’un lab publie des chiffres de ce type, est de savoir si on mesure la capacité du modèle ou la qualité de l’infrastructure qui l’entoure.

Le prix comme arme compétitive. Deux ID modèles avec le même moteur. La version standard, muse-spark-1.2, coûte 1,25 dollar par million de tokens en input et 4,25 en output, en ligne avec Gemini 3.6 Flash (1,50/7,50). La version contributor, muse-spark-1.2-contributor, descend à 0,10/0,20 dollar, proche de GPT-5.6 Luna (0,20/1,20) et Gemini 3.1 Flash-Lite (0,25/1,50). La différence est le consentement sur les données : dans la version contributor, Meta utilise tes conversations pour l’entraînement. Elle transforme la confidentialité en rabais : qui cède ses données paie un ordre de grandeur moins.

Limites. Les résultats des olympiades sont auto-déclarés par Meta, même si trois ont été évalués dans des conditions de compétition officielles. Le « no tools » est une revendication que le débat académique remet en question. Les prix sont publics, mais la capacité de serving réelle reste un point ouvert. Il n’y a pas encore de tests indépendants sur les tâches de production, que des benchmarks. Pour qui évalue le modèle, vaut le principe habituel : les benchmarks mesurent des moyennes, pas ton cas particulier.

Tapez pour chercher dans cours, playbooks, skills, papers…