Muse Spark 1.2 de Meta alcanza la frontera a 0,69 dólares por test: el precio se convierte en criterio competitivo
Muse Spark 1.2, la actualización del modelo de coding que Meta lanzó en julio, entra en el top 5 del Vals Index a 0,69 dólares por test. Tres veces menos que Kimi, diez veces menos que Claude Opus, Fable y GPT-5.6 Sol. Es también el primer modelo por encima del 60% en Finance Agent v2, a 0,77 dólares contra los 5,12 de Opus 5.
Meta declara resultados de medalla de oro en cinco olimpiadas STEM, con puntuaciones perfectas en pruebas teóricas de física. Los obtuvo mediante razonamiento puro y orquestación multi-agente en paralelo, sin llamar a herramientas externas.
Para quienes usan IA en su trabajo, la señal cuenta más que los números aislados. El precio por tarea correcta se está convirtiendo en el discriminante entre modelos frontera. Cuando las prestaciones son similares, lo que decide es el costo. Es el mismo patrón que vimos con DeepSeek V4-Flash y con la reducción del 80% en el precio de Luna.
Meta también ofrece una versión “contributor” a 0,10 dólares por millón de tokens de entrada y 0,20 de salida, si aceptas que tus datos sirvan para entrenar sus modelos. La versión estándar cuesta 1,25/4,25.
En detalle
Qué había antes. Meta llegó tarde a la carrera de los coding agents. Muse Spark 1.1, en julio, tenía precios agresivos pero prestaciones aún por debajo de la categoría frontera. El salto de 1.2 viene del escalado del entrenamiento en coding: Meta aumentó el compute en tareas de codificación, diversificó los entornos de entrenamiento y co-entrenó el modelo con Muse Code, su coding agent propietario. La idea es que el modelo rinde mejor cuando está vinculado a su harness específico.
Los números en el Vals Index. 1.2 pasa de “fuera de clasificación” a top 5 a 0,69 dólares por test. En Finance Agent v2, es el primero por encima del 60% de precisión a 0,77 dólares por intento, contra los 5,12 de Opus 5, y con el doble de velocidad. Artificial Analysis registró uno de los mayores saltos de puntuación para 1.2 tras la actualización de criterios de evaluación (patch v4.1.1). Cuánto del salto es real y cuánto es cambio de calificación sigue sin aclararse, pero el patrón es coherente entre dos benchmarks independientes.
Las olimpiadas sin herramientas. Meta participó en cinco olimpiadas STEM (física, matemáticas, química, razonamiento matemático) obteniendo nivel de medalla de oro en todas, tres de ellas bajo condiciones de competencia oficial con evaluación oficial. El detalle que encendió el debate es el “sin herramientas”: sin búsqueda, sin código, sin calculadora. Solo razonamiento, con orquestación multi-agente en paralelo. François Chollet y otros debatieron cuánto del resultado es el modelo y cuánto es el harness. La pregunta de fondo, que reaparece cada vez que un lab publica números como estos, es si estamos midiendo la capacidad del modelo o la calidad de la infraestructura que lo rodea.
El precio como arma competitiva. Dos ID de modelo con el mismo motor. La versión estándar, muse-spark-1.2, cuesta 1,25 dólares por millón de tokens de entrada y 4,25 de salida, en línea con Gemini 3.6 Flash (1,50/7,50). La versión contributor, muse-spark-1.2-contributor, baja a 0,10/0,20 dólares, cerca de GPT-5.6 Luna (0,20/1,20) y Gemini 3.1 Flash-Lite (0,25/1,50). La diferencia es el consentimiento de datos: en la versión contributor, Meta usa tus conversaciones para entrenar. Transforma la privacidad en descuento: quien cede sus datos paga un orden de magnitud menos.
Limitaciones. Los resultados de las olimpiadas son autodeclarados por Meta, aunque tres fueron evaluados bajo condiciones de competencia oficial. El “sin herramientas” es una afirmación que el debate académico está cuestionando. Los precios son públicos, pero la capacidad de serving real sigue siendo un punto abierto. Aún no hay pruebas independientes en tareas de producción, solo benchmarks. Para quien evalúa el modelo, vale el principio de siempre: los benchmarks miden promedios, no tu caso.