Radar · 17/07/2026 · fatto del 16/07/2026 · modelli

Quattro modelli a confronto sulle clip musicali: quando il benchmark diventa usabile

TryAI ha costruito un harness agentico che dà a un modello una canzone, un budget in dollari e sei strumenti (ricerca web, generazione immagini/video, ffmpeg locale), poi lo lascia lavorare da solo fino al video finito. L’hanno fatto girare su quattro modelli — Claude Fable 5, GPT-5.6 Sol, Grok 4.5 e il nuovo Muse Spark di Meta — a due budget ciascuno ($25 e $100), sulla stessa canzone (Uptown Funk).

Tutti e quattro hanno prodotto un video completo. Claude Fable 5 a $100 ha generato 80 clip (il numero più alto) spendendo $48.60 e ha scelto un solo modello video (Seedance 1.0 Pro). GPT-5.6 Sol a $100 ne ha generate 70, spendendo $36.57, e ha mixato tre modelli video diversi in un solo run. A $25 Sol ha usato un’architettura immagine-prima-poi-video, gli altri sono andati diretti da testo a video.

I log completi di ogni run — ogni piano, ogni chiamata tool, ogni errore — sono su GitHub. La differenza con un benchmark classico: qui vedi il video che ogni modello ha prodotto, leggi come ha lavorato e quanto ha speso, e decidi tu quale approccio preferisci. Non c’è un punteggio finale: c’è il materiale per giudicare.

Nel dettaglio

L’architettura del test.

Il sistema dà al modello sei strumenti:

  • plan: per pensare senza costi né azioni.
  • web_search: per cercare quali modelli di generazione esistono, leggere le API e documentarsi sui video musicali.
  • get_budget: per sapere quanto resta.
  • generate_image e generate_video: gli unici due che consumano budget, con accesso a FAL e Replicate. Il modello sceglie quale modello sottostante chiamare e con quali parametri.
  • run_command: una shell locale con ffmpeg/ffprobe, per tagliare, concatenare clip e muxare l’audio finale.

Una volta esaurito il budget, le chiamate a pagamento vengono rifiutate, ma il modello può continuare a editare. Ogni messaggio, tool call, addebito ed errore finisce nel log.

I numeri nel dettaglio.

A $25, entrambi i modelli hanno quasi esaurito il budget: Claude Fable 5 ha speso $24.30, GPT-5.6 Sol $23.18. A $100 la storia diverge: GPT-5.6 Sol si è fermato a $36.57, Claude Fable 5 è arrivato a $48.60. Più budget ha significato più footage per entrambi.

Il costo totale include anche i token del modello, che per Claude Fable 5 ($10/$50 per milione input/output) ha aggiunto fra $16.99 e $25.05 a run, circa il 30-40% del totale. GPT-5.6 Sol ($5/$30) è rimasto sotto i $5 di token grazie al prompt caching.

Le chiamate fallite (per lo più errori di rete transitori ai provider) non sono state addebitate, ma il modello ha speso step per ritentarle: da zero (Fable 5 a $100) a dieci (Sol a $25).

Le scelte architetturali.

Tre run su quattro sono andati text-to-video puro. Solo GPT-5.6 Sol a $25 ha usato un’architettura diversa: prima ha generato keyframe con FLUX schnell ($0.003 per immagine), poi li ha animati con Wan 2.2-5b image-to-video ($0.10 al secondo).

GPT-5.6 Sol a $100 ha mixato tre modelli video nello stesso run: Wan 2.5 ($0.05/s), Veo 3.1 Lite ($0.10/s) e Hailuo 2.3 Standard (~$0.28 per clip da 6 secondi). Claude Fable 5 a $100 ha scelto un solo modello (Seedance 1.0 Pro, ~$0.12/s a 1080p) e ha generato il maggior numero di clip distinte (80).

I prezzi citati sono quelli listati da FAL, che possono divergere dai listini ufficiali dei provider.

Perché conta.

Questo test anticipa una guerra di prestazioni e prezzi nei tool di generazione multimodale. Non è un benchmark accademico: è un confronto eseguibile, con risultati visibili e costi misurati. Chiunque può clonare il repo e rifarlo sui propri prompt.

Per chi sviluppa o valuta agenti, il dataset qui è il codice stesso: l’harness, i log, i video finali. È il tipo di valutazione che manca nei comunicati: trasparente, riproducibile, e con l’output finale che puoi giudicare tu.

Il limite: un solo caso (una canzone), quattro modelli, un’architettura fissa. Non è una valutazione generale, ma un esempio di come si valuta bene: con materiale verificabile e criteri dichiarati prima.

Scrivi per cercare fra corso, playbook, skill, paper…