DeepSeek V4-Flash eguaglia GPT-5.6 Luna a un costo per task inferiore del 60%
DeepSeek ha rilasciato V4-Flash-0731, l’aggiornamento del suo modello open da 284 miliardi di parametri totali e 13 miliardi attivi (MoE), con contesto da 1 milione di token. Sull’Intelligence Index di Artificial Analysis il modello passa da 40 a 50 punti, un punto dietro GPT-5.6 Luna, a un costo per task inferiore del 60%. I pesi sono aperti sotto licenza MIT, disponibili subito su Hugging Face.
Il salto di prestazioni arriva interamente dal post-training, non da cambi di architettura o dimensione: Terminal-Bench passa da 56.9 a 82.7, e l’uso di token in output cala del 12% rispetto al predecessore. Il prezzo API è di 0,14 dollari per milione di token in input e 0,28 in output, con uno sconto del 98% sui token in cache (0,0028 dollari al milione).
Per chi costruisce agenti, il calcolo cambia in fretta. Lo stesso giorno in cui OpenAI taglia l’80% del prezzo di GPT-5.6 Luna, DeepSeek offre prestazioni quasi equivalenti a una frazione del costo, con pesi scaricabili. Il trade-off fra modello capace e modello economico, che si era assottigliato ieri, oggi si complica: c’è un terzo contendente aperto.
Se vuoi provarci: il modello è disponibile su OpenRouter come deepseek/deepseek-v4-flash-0731. Il livello di reasoning predefinito lascia a desiderare su alcuni task; alzarlo a “high” cambia i risultati in modo visibile.
Nel dettaglio
Cosa c’era prima.
Fino a ieri, la guerra dei prezzi fra modelli frontier aveva due fronti: OpenAI da una parte, Anthropic e Google dall’altra. I modelli aperti cinesi (Kimi K3, Qwen 3.8) avevano chiuso il gap tecnico, ma restavano indietro sui task agentici complessi. V4-Flash nella sua versione di aprile segnava 56.9 su Terminal-Bench e 40 punti sull’Intelligence Index: utile, ma non un sostituto del frontier.
Cosa cambia con l’aggiornamento 0731.
Il salto è interamente nel post-training. DeepSeek non ha toccato architettura o dimensione: stessi 284 miliardi di parametri totali, stessi 13 miliardi attivi per token (256 esperti, 6 attivi). Quello che è cambiato è la qualità dell’addestramento post-supervisionato, soprattutto su task agentici come uso degli strumenti, pianificazione multi-passo e reasoning lungo.
I numeri chiave, misurati da Artificial Analysis il 31 luglio 2026:
- Intelligence Index: 40 → 50 (GPT-5.6 Luna è a 51)
- Terminal-Bench: 56.9 → 82.7
- GDPval-AA v2 Elo: 1189 → 1559
- Output token: -12% rispetto al predecessore
Il prezzo API di prima parte è aggressivo: 0,14 dollari per milione di token in input, 0,28 in output. Lo sconto sui token in cache è del 98% (0,0028 dollari al milione), un livello che cambia il costo reale quando un agente lavora su un contesto lungo e stabile.
Dettagli tecnici per non ingegneri.
V4-Flash è un Mixture of Experts: 284 miliardi di parametri distribuiti su 256 esperti, ma per ogni token generato ne attiva solo 6. È come avere una squadra di 256 specialisti e chiamarne 6 per ogni domanda. Questo tiene bassi i costi di inferenza pur avendo una capacità totale simile a modelli molto più grandi. Il modello supporta tre livelli di reasoning effort e include un modulo di speculative decoding che si attiva con un flag.
I pesi aperti, e perché conta.
I pesi sono usciti sotto licenza MIT lo stesso giorno dell’API. Puoi scaricare il modello, ospitarlo sui tuoi server, modificarlo. Non sei vincolato all’API di DeepSeek. Le versioni quantizzate per uso locale girano con 168 GB di RAM per il 4-bit e 110 GB per il 3-bit.
Questo accade mentre la Casa Bianca valuta bando mirati sui modelli open-weight cinesi e i lab proprietari fanno fronte comune sui rischi dei pesi aperti. Per chi costruisce su modelli open, la disponibilità di un modello competitivo sotto MIT è un fatto concreto: più provider lo offrono, più l’infrastruttura è ridondante.
Limiti.
Il modello è text-only: niente visione, niente audio. Il salto di prestazioni è misurato sui benchmark di Artificial Analysis e dalla community, non da una valutazione indipendente terza. Il livello di reasoning predefinito produce risultati deludenti su alcuni task: bisogna alzarlo a “high” per ottenere il meglio, il che aumenta il costo e la latenza. È una public beta: il comportamento può cambiare.