Radar · 17/07/2026 · ocurrido el 16/07/2026 · modelos

Cuatro modelos en competencia: clips musicales cuando el benchmark se vuelve útil

TryAI construyó un harness agéntico que entrega a un modelo una canción, un presupuesto en dólares y seis herramientas (búsqueda web, generación de imágenes/videos, ffmpeg local), luego lo deja trabajar solo hasta terminar el video. Lo ejecutaron en cuatro modelos — Claude Fable 5, GPT-5.6 Sol, Grok 4.5 y el nuevo Muse Spark de Meta — con dos presupuestos cada uno ($25 y $100), sobre la misma canción (Uptown Funk).

Todos cuatro produjeron un video completo. Claude Fable 5 a $100 generó 80 clips (el número más alto) gastando $48.60 y eligió un único modelo de video (Seedance 1.0 Pro). GPT-5.6 Sol a $100 generó 70, gastando $36.57, y combinó tres modelos de video diferentes en una sola ejecución. A $25, Sol utilizó una arquitectura imagen-primero-luego-video, los otros fueron directamente de texto a video.

Los registros completos de cada ejecución — cada plan, cada llamada de herramienta, cada error — están en GitHub. La diferencia con un benchmark clásico: aquí ves el video que cada modelo produjo, lees cómo trabajó y cuánto gastó, y decides cuál enfoque prefieres. No hay una puntuación final: hay material para juzgar.

En detalle

La arquitectura de la prueba.

El sistema entrega al modelo seis herramientas:

  • plan: para pensar sin costos ni acciones.
  • web_search: para buscar qué modelos de generación existen, leer las APIs y documentarse sobre videos musicales.
  • get_budget: para saber cuánto queda.
  • generate_image y generate_video: los únicos dos que consumen presupuesto, con acceso a FAL y Replicate. El modelo elige cuál modelo subyacente llamar y con qué parámetros.
  • run_command: una shell local con ffmpeg/ffprobe, para cortar, concatenar clips y mezclar el audio final.

Una vez agotado el presupuesto, se rechazan las llamadas de pago, pero el modelo puede seguir editando. Cada mensaje, llamada de herramienta, cargo y error termina en el registro.

Los números en detalle.

A $25, ambos modelos casi agotaron el presupuesto: Claude Fable 5 gastó $24.30, GPT-5.6 Sol $23.18. A $100 la historia diverge: GPT-5.6 Sol se detuvo en $36.57, Claude Fable 5 llegó a $48.60. Más presupuesto significó más material para ambos.

El costo total incluye también los tokens del modelo, que para Claude Fable 5 ($10/$50 por millón entrada/salida) agregó entre $16.99 y $25.05 por ejecución, aproximadamente el 30-40% del total. GPT-5.6 Sol ($5/$30) se mantuvo bajo los $5 de tokens gracias al cached prompting.

Las llamadas fallidas (principalmente errores de red transitorios en proveedores) no fueron cobradas, pero el modelo gastó pasos reintentándolas: desde cero (Fable 5 a $100) hasta diez (Sol a $25).

Las opciones arquitectónicas.

Tres ejecuciones de cuatro fueron text-to-video puro. Solo GPT-5.6 Sol a $25 utilizó una arquitectura diferente: primero generó fotogramas clave con FLUX schnell ($0.003 por imagen), luego los animó con Wan 2.2-5b image-to-video ($0.10 por segundo).

GPT-5.6 Sol a $100 combinó tres modelos de video en la misma ejecución: Wan 2.5 ($0.05/s), Veo 3.1 Lite ($0.10/s) y Hailuo 2.3 Standard (~$0.28 por clip de 6 segundos). Claude Fable 5 a $100 eligió un único modelo (Seedance 1.0 Pro, ~$0.12/s a 1080p) y generó la mayor cantidad de clips distintos (80).

Los precios citados son los listados por FAL, que pueden divergir de los listados oficiales de los proveedores.

Por qué importa.

Esta prueba anticipa una guerra de rendimiento y precios en herramientas de generación multimodal. No es un benchmark académico: es una comparación ejecutable, con resultados visibles y costos medidos. Cualquiera puede clonar el repositorio y repetirlo con sus propios prompts.

Para quienes desarrollan o evalúan agentes, el dataset aquí es el código mismo: el harness, los registros, los videos finales. Es el tipo de evaluación que falta en los comunicados de prensa: transparente, reproducible, y con el resultado final que puedes juzgar tú.

La limitación: un solo caso (una canción), cuatro modelos, una arquitectura fija. No es una evaluación general, pero es un ejemplo de cómo evaluar bien: con material verificable y criterios declarados de antemano.

Escribe para buscar en curso, playbooks, skills, papers…