Radar · 07/08/2026 · fatto del 06/08/2026 · modelli

Qwen3.8 Max in vetta all'agentic index: il frontier cinese open-weight compete sull'orchestration

Qwen3.8 Max ha raggiunto il primo posto sull’agentic index di Artificial Analysis, affiancando GPT-5.6 Sol sui compiti di orchestration. Il modello open-weight da 2.4T di Alibaba compete sul campo che conta di più per chi costruisce agenti: task multi-passo con strumenti, non conversazione.

Due giorni fa raccontavamo Qwen3.8-Max per i segnali di produzione, quando Alibaba apriva i pesi e OpenAI documentava il valore di Circles in telco. Ora il frontier cinese passa un altro esame, e lo passa dove la chat non basta.

L’agentic index v4.1.1 pesa nove valutazioni che vanno oltre la risposta singola: automazione bancaria, coding al terminale, reasoning su esami difficili. Sono compiti dove il modello pianifica, chiama strumenti, recupera contesto su sequenze lunghe. La classifica colloca Qwen3.8 Max come modello overall migliore su questa combinazione.

Per chi scala agenti, la conseguenza è concreta. Se un modello open-weight eguaglia il frontier proprietario sull’orchestration, la scelta del modello base cessa di essere il vincolo principale. Costo per task, latenza e governance dei dati diventano i criteri reali. Un frontier con pesi scaricabili cambia il calcolo per chi deve decidere cosa gira nel proprio stack, e fin dove può controllarlo.

Nel dettaglio

L’agentic index di Artificial Analysis è uno dei riferimenti per chi valuta modelli sul lavoro agentico invece che sulla conversazione. La versione 4.1.1 pesa nove valutazioni: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR. I nomi sono tecnici, ma il pattern è chiaro. Sono compiti dove il modello combina più passi, usa strumenti e mantiene coerenza su sequenze che durano. Niente domande a risposta singola.

Qwen3.8 Max in cima a questa classifica significa che il modello da 2.4T parametri di Alibaba, i cui pesi sono scaricabili da pochi giorni, tiene il passo del frontier proprietario di OpenAI sul lavoro che costa di più in produzione. Il pezzo del 3 agosto raccontava l’arrivo di Qwen3.8-Max negli stack USA come secondo gigante cinese dopo Kimi K3. Adesso c’è una misura indipendente che dice: il modello è sia disponibile che competitivo sul compito pesante.

Il punto per chi decide è pratico. Fino a ieri il frontier proprietario, GPT-5.6 o Claude Opus 5, era la scelta obbligata per i task agentici complessi. Il modello open serviva per costi bassi o privacy, ma cedeva sulla qualità quando il compito richiedeva pianificazione e uso di strumenti su più turni. Se la distanza sull’agentic index si chiude, la decisione si sposta su fattori che prima venivano dopo: quanto costa ogni task, quanto ci mette a rispondere, dove girano i pesi, chi vede i log. Il modello base diventa una variabile fra tante.

Pensa a un agente che legge la casella email, classifica i messaggi e produce un report mattutino. Se il modello open-weight regge l’orchestrazione come il frontier, puoi far girare i pesi in locale o su un provider economico senza perdere qualità sul passaggio critico. Il risparmio si vede sul costo per task, non sul punteggio.

Restano i limiti. Un benchmark agentic misura prestazioni su task standardizzati, con dati puliti e obiettivi stabili. La produzione raramente è così. Gli utenti cambiano idea a metà, i dati sono sporchi, il contesto si allunga oltre la finestra. I modelli che brillano sui benchmark possono faticare dove il caso reale diverge dal test.

C’è poi il versante geopolitico. L’amministrazione USA valuta divieti mirati su singoli modelli cinesi aperti, e un modello cinese in cima a una classifica agentic accelera quella conversazione. Per chi usa il modello oggi, la domanda pratica è se i pesi resteranno accessibili domani.

Quello che manca dalla classifica è il costo per task. Artificial Analysis lo pubblica accanto all’indice di intelligenza, ma il posizionamento in vetta non dice automaticamente che Qwen3.8 Max sia anche la scelta più economica. Prima di spostare produzione su un modello nuovo, conviene costruirsi un banco di prova con i propri casi e confrontare costo, latenza e qualità sul lavoro vero.

Scrivi per cercare fra corso, playbook, skill, paper…