AI

DeepSeek V4 Pro 0813 GA: un modello open-weight batte Opus 4.8 su Terminal-Bench

DeepSeek V4 Pro 0813 GA: un modello open-weight batte Opus 4.8 su Terminal-Bench

DeepSeek V4 Pro 0813 GA: un modello open-weight batte Opus 4.8 su Terminal-Bench

TL;DR

DeepSeek-V4-Pro-0813 è disponibile a livello generale dal 13 agosto 2026: la preview di aprile diventa una build di produzione per app, web e API. Il modello Mixture-of-Experts da 1.600 miliardi di parametri — di cui 49 miliardi attivi per token — ottiene l'87,9% su Terminal-Bench 2.1, superando di poco Claude Opus 4.8 (85,0%). È la prima volta che un modello open-weight supera un modello chiuso di frontiera su questo benchmark. Con verifica indipendente raggiunge il 96,40% su SWE-bench Verified, risultando il modello open-weight con il punteggio più alto in classifica. Tuttavia i pesi della versione GA non sono ancora su Hugging Face, il 16 agosto scatta un aumento di prezzo significativo e diversi benchmark autodichiarati attendono ancora una replica indipendente.

La release GA: che cosa è cambiato davvero

DeepSeek ha scaglionato deliberatamente il rilascio di V4. La famiglia è comparsa inizialmente come preview open-weight il 24 aprile 2026, con le varianti Pro e Flash entrambe rilasciate con licenza MIT. Il 31 luglio 2026 il più piccolo modello Flash (284 miliardi di parametri totali / 13 miliardi attivi) è arrivato per primo alla versione finale, con pesi aperti su Hugging Face. La build Pro doveva «seguire a breve» — promessa mantenuta con la build 0813, comparsa sull'endpoint dell'API il 12 agosto e confermata ufficialmente in GA il 13 agosto.

Rispetto alla preview di aprile, la release GA introduce quattro novità concrete:

  • Tre livelli di sforzo di ragionamento: low, high e max — per bilanciare latenza e accuratezza
  • Supporto nativo alla Responses API per workflow agentici con uso di strumenti
  • Output massimo esteso a 384K token (rispetto al limite della preview)
  • DeepSeek Harness (dsh) — un nuovo harness nativo per agenti di coding, che ha raccolto 72.000 stelle su GitHub in una notte

Che cosa la release GA non ha portato: pesi aperti aggiornati per il checkpoint 0813. Il repository Hugging Face ospita ancora i pesi della preview di aprile. La build di produzione è al momento accessibile solo tramite API e app.

Architettura: MoE su una scala senza precedenti

La scommessa di DeepSeek sul Mixture-of-Experts (MoE) raggiunge con V4 Pro la sua forma più estrema. Il modello conta 1.600 miliardi di parametri totali, ma ne attiva solo circa 49 miliardi per token — un tasso di attivazione del 3% che tiene sotto controllo i costi di inferenza pur dando a ogni token accesso a reti di esperti specializzate.

Tra le principali innovazioni architetturali:

  • Sistema di attention ibrido: combina Compressed Sparse Attention e Heavily Compressed Attention per elaborare in modo efficiente i contesti lunghi
  • Manifold-Constrained Hyper-Connections — un nuovo meccanismo di routing per la selezione degli esperti
  • Ottimizzatore Muon — usato in addestramento per una convergenza migliore
  • Guadagni di efficienza: con un contesto di 1 milione di token, V4 Pro richiede solo il 27% dei FLOP di inferenza per token e il 10% della memoria KV-cache di DeepSeek V3.2

L'architettura è condivisa con V4 Flash, ma scalata in modo drastico. Entrambi i modelli supportano una finestra di contesto di 1 milione di token — circa 1.500 pagine A4 di testo.

Risultati dei benchmark: dove vince V4 Pro

La build 0813 mostra progressi notevoli rispetto alla preview di aprile, soprattutto nelle capacità agentiche. Il quadro completo:

Benchmark autodichiarati (valutazione di DeepSeek)

BenchmarkPreview di aprileV4 Pro 0813Delta
Terminal-Bench 2.172,1%87,9%+15,8
DeepSWE12,8%62,7%+49,9
NL2Repo38,5%61,5%+23,0
CyberGym52,7%83,3%+30,6
Toolathlon Verified55,9%74,1%+18,2
AutomationBench12,8%31,8%+19,0
DSBench-FullStack—71,1%—
DSBench-Hard—67,2%—

Risultati verificati in modo indipendente

Vals.ai ha sottoposto V4 Pro 0813 alla propria pipeline di valutazione indipendente e ha confermato:

  • SWE-bench Verified: 96,40% — 2° su 82 modelli, il modello open-weight con il punteggio più alto in classifica (davanti a Kimi K3 con il 93,40%)
  • Vals Index: 52,37% — 18° su 46 modelli, 9,48 punti in più rispetto a DeepSeek V4 (42,89%)
  • Costo per test: 0,02 dollari — contro 1,29 dollari per Claude Opus 5 al 97,00%

Artificial Analysis assegna a V4 Pro 0813 un punteggio di 53 nel suo Intelligence Index, rendendolo il secondo modello open-weight più intelligente mai valutato. È anche più efficiente nell'uso dei token rispetto alla versione di aprile, con circa il 30% di token di output in meno sull'indice.

Il Center for AI Standards and Innovation (CAISI) del NIST aggiunge il punto di vista di un ente pubblico. Ad aprile 2026 ha valutato in modo indipendente la preview di V4 Pro su nove benchmark in cinque domini, tra cui due valutazioni non pubbliche progettate per resistere alla contaminazione:

«Secondo i dati di DeepSeek, DeepSeek V4 è capace all'incirca quanto Opus 4.6 e GPT-5.4, rilasciati circa due mesi prima. Tuttavia, le valutazioni di CAISI, che includono benchmark non pubblici, indicano che DeepSeek V4 ottiene prestazioni simili a GPT-5, rilasciato circa otto mesi prima.» — NIST CAISI, Evaluation of DeepSeek V4 Pro

Il divario non è uniforme ed è stato misurato sulla build di preview di aprile, non sul checkpoint 0813: resta quindi da capire quanto il post-training lo abbia ridotto. È istruttivo osservare dove è più ampio: 32% su CTF-Archive-Diamond contro il 71% di GPT-5.5 nella cybersicurezza e 46% sul set semi-privato di ARC-AGI-2 contro il 79% nel ragionamento astratto — mentre in matematica il modello è quasi alla pari con la frontiera.

Il titolo su Terminal-Bench

Qui la storia si fa interessante. Su Terminal-Bench 2.1 — il benchmark che misura attività reali da terminale e di computer use — V4 Pro 0813 ottiene l'87,9%, rispetto a:

  • Claude Opus 4.8: 85,0%
  • Claude Fable 5: 88,0%
  • V4 Flash 0731: 82,7%
  • GLM-5.2: 81,0%

V4 Pro non si limita a battere Opus 4.8: è quasi alla pari con Claude Fable 5, il modello più recente di Anthropic. Per un modello open-weight a una frazione del costo, è un traguardo importante.

V4 Pro vs Claude Opus 4.8: il confronto completo

Il titolo dice «batte Opus 4.8 su Terminal-Bench», ma il quadro completo è più sfumato. Nessuno dei due modelli è migliore in tutto: le vittorie si distribuiscono su capacità diverse.

DimensioneDeepSeek V4 Pro 0813Claude Opus 4.8
Terminal-Bench 2.187,9%85,0%
LiveCodeBench93,5%88,8%
SWE-bench Verified96,40%97,00%
SWE-bench Pro55,4%69,2%
AA Intelligence Index52–5357–61
Costo (per milione di token di output)0,87 $25,00 $
Velocità (token/s)72,455,7
Tempo al primo token1,77 s30,22 s
Finestra di contesto1M1M
Token di output max.384K—
Pesi apertiMIT (solo preview)Chiuso

Lo schema è chiaro: DeepSeek vince su costi, velocità, coding algoritmico e attività da terminale. Opus 4.8 vince sull'ingegneria del software a livello di repository, sull'intelligenza generale e sull'affidabilità. Il divario di prezzo di 28 volte rende V4 Pro la scelta predefinita per l'elaborazione batch, i loop di coding ad alto volume e i workflow agentici sensibili ai costi.

La questione dei pesi aperti

Qui la storia si complica. DeepSeek ha costruito la propria reputazione sulle release open-weight, e la famiglia V4 è stata annunciata con pesi su licenza MIT. Ma c'è un problema:

  • V4 Flash 0731: i pesi sono disponibili su Hugging Face con licenza MIT. Ospitabile in proprio già oggi.
  • V4 Pro 0813 (GA): i pesi NON sono stati rilasciati. Il repository Hugging Face mostra ancora il checkpoint della preview di aprile.

Ciò significa che i team che puntano sul self-hosting per motivi di data governance stanno eseguendo la preview di aprile, non la build di produzione. DeepSeek non ha dichiarato esplicitamente quando (o se) i pesi 0813 verranno pubblicati. La decisione segnala un possibile cambio di strategia verso la monetizzazione del modello di punta tramite API.

Per i settori regolamentati questo conta. L'API ospitata trasferisce i dati ai server di DeepSeek in Cina, assoggettandoli alla normativa cinese sui dati. Ospitare in proprio i pesi su licenza MIT su un'infrastruttura al di fuori della Cina elimina il problema del trasferimento — ma solo se quei pesi corrispondono davvero al checkpoint di produzione.

Prezzi: la buona e la cattiva notizia

Prezzi attuali (fino al 15 agosto 2026)

DeepSeek offre V4 Pro 0813 agli stessi prezzi del precedente modello in preview:

  • Input: 0,435 dollari per milione di token
  • Output: 0,87 dollari per milione di token
  • Cache hit: circa 0,004 dollari per milione di token (sconto del 99%)

Prezzi di picco (dal 16 agosto 2026)

Il 16 agosto entra in vigore una ristrutturazione significativa:

  • Input: 1,32 dollari per milione di token (+204%)
  • Output: 3,96 dollari per milione di token (+355%)
  • Cache hit: 0,044 dollari per milione di token (sconto del 97%, ma 12 volte più caro di prima)
  • Fasce di minor traffico: sconto del 50% su tutti i livelli

L'aumento medio ponderato è di circa il 264%. Anche ai prezzi di picco, V4 Pro resta molto più economico di Claude Opus 4.8 (3,85 dollari per milione di token con un rapporto di cache 7:2:1). Ma la finestra dell'«intelligenza di frontiera a prezzi assurdamente bassi» si sta chiudendo.

La sfida delle 24 ore: V4 Pro vs GLM-5.3

DeepSeek non è stato l'unico laboratorio cinese a rilasciare modelli di frontiera questa settimana. Zhipu ha pubblicato GLM-5.3 il 14 agosto 2026 — esattamente 24 ore dopo la GA di V4 Pro — con una filosofia completamente diversa:

DimensioneV4 Pro 0813GLM-5.3
ArchitetturaNuovo MoE da 1,6T, 49B attiviStessa base da 743B di GLM-5.2
PesiMIT (solo preview)Aperti entro ~2 settimane dopo la revisione di sicurezza
SWE-bench Verified96,40%Non ancora comunicato
CyberGym83,3%84,5%
AutomationBench31,8%48,2%
Output max.384K128K
Prezzi API0,435 $/0,87 $ (in aumento a 1,32 $/3,96 $)Abbonamento 18–168 $/mese, API da definire

Entrambi rivendicano la corona del coding tra i modelli open-weight. V4 Pro domina su SWE-bench Verified e per dimensioni. GLM-5.3 è avanti nei benchmark agentici e mantiene la stessa architettura con un post-training esteso. La concorrenza spinge entrambi i laboratori a rilasciare più velocemente e a costi più bassi.

Che cosa significa per gli sviluppatori

Quando scegliere V4 Pro 0813

  • Programmazione algoritmica e competitiva — LiveCodeBench al 93,5%, davanti a Opus 4.8
  • Agenti da terminale e di computer use — Terminal-Bench 2.1 all'87,9%, in testa tra i modelli open-weight
  • Elaborazione batch ad alto volume — con costi 28 volte inferiori a Opus, i numeri parlano da soli
  • Ragionamento su contesti lunghi — 1M di contesto con 384K di output, ideale per pipeline di analisi documentale
  • Loop agentici sensibili ai costi — cache hit quasi gratuiti rendono sostenibili gli agenti multi-turno

Quando restare su Opus 4.8

  • Refactoring a livello di repository — il divario su SWE-bench Pro è di 13,8 punti (69,2% vs 55,4%)
  • Lavoro agentico su più file — il divario cresce ulteriormente nelle attività che coinvolgono 4 o più file
  • SLA e supporto enterprise — le garanzie di affidabilità di Anthropic restano ineguagliate
  • Data governance — se non può utilizzare un'API ospitata in Cina e i pesi aperti non sono aggiornati

Quando valutare alternative

  • Self-hosting: V4 Flash 0731 è attualmente l'unico modello DeepSeek con pesi GA disponibili
  • Multilinguismo oltre mandarino e inglese: i punteggi AA Index di V4 Pro indicano una copertura multilingue inferiore alla media
  • Attività di cybersicurezza: la valutazione del NIST sulla build di preview ha registrato il 32% contro il 71% di GPT-5.5 su CTF-Archive-Diamond

Il divario di verifica

La tabella di valutazione di DeepSeek mostra numeri impressionanti, ma restano diverse riserve:

  1. Il riferimento è autoreferenziale: la maggior parte dei progressi è misurata rispetto alla preview di aprile della stessa DeepSeek, non rispetto ai concorrenti
  2. Le verifiche indipendenti sono parziali: Vals.ai ha confermato SWE-bench Verified, ma gli altri benchmark restano dichiarati dal produttore — un problema ricorrente nella valutazione dei modelli di IA
  3. La valutazione del NIST riguarda la build di preview: non è noto se la 0813 abbia colmato i divari in cybersicurezza e ragionamento astratto
  4. Nessun audit di sicurezza dei pesi: non è stato pubblicato alcun audit di sicurezza indipendente e nominativo di V4 Pro

La community open-weight sta già mettendo alla prova queste affermazioni. Il thread su Reddit r/LocalLLaMA mostra un'accoglienza contrastante — entusiasmo per i salti nei benchmark, scetticismo per l'assenza dei pesi GA e dibattito sulla tenuta dei numeri autodichiarati alla prova della replica da parte della community.

FAQ

DeepSeek V4 Pro 0813 è davvero open source?

DeepSeek V4 Pro è stato annunciato con pesi su licenza MIT, e il checkpoint della preview di aprile è disponibile su Hugging Face. I pesi della build GA 0813, però, non sono stati rilasciati: sono pubblici solo quelli della preview di aprile. Lei può quindi ospitare in proprio già oggi il modello in preview, ma non la build di produzione che ha ottenuto i punteggi finiti sui titoli. DeepSeek non ha indicato quando o se i pesi 0813 verranno pubblicati, il che suggerisce un possibile allontanamento dall'approccio tradizionalmente aperto a favore di una monetizzazione incentrata sull'API per il modello di punta.

Come si confronta V4 Pro 0813 con Claude Opus 4.8 nelle attività di coding?

Il confronto dipende molto dal tipo di attività. Su SWE-bench Verified (correzione di singoli bug), V4 Pro ottiene il 96,40% con verifica indipendente, quasi alla pari con il 97% di Opus 4.8. Su SWE-bench Pro (ingegneria multi-file a livello di repository), Opus 4.8 è avanti di 13,8 punti: 69,2% contro 55,4%. Nel coding algoritmico (LiveCodeBench) vince V4 Pro con il 93,5% contro l'88,8%. Su Terminal-Bench 2.1 (attività reali da terminale), V4 Pro è di poco avanti con l'87,9% contro l'85,0%. L'indicazione pratica: affidare a V4 Pro il lavoro algoritmico e su singoli file e riservare Opus al refactoring complesso su più file.

Di quale hardware ho bisogno per ospitare in proprio DeepSeek V4 Pro?

Ospitare V4 Pro a precisione piena richiede hardware multi-GPU di classe H100 o H200, a causa dei 1.600 miliardi di parametri totali. Anche con 49 miliardi di parametri attivi per token, l'intera matrice dei pesi deve essere caricata in memoria. Il più piccolo V4 Flash (284 miliardi totali / 13 miliardi attivi) può girare su una singola GPU da 80 GB se quantizzato. Le quantizzazioni della community di Unsloth vanno da una versione a 3 bit da 103 GB a un GGUF a 8 bit senza perdita da 162 GB. Per i team senza infrastruttura multi-GPU, l'API ospitata a 0,435/0,87 dollari per milione di token (prezzi precedenti al 16 agosto) resta la via d'accesso più pratica.

Che cos'è il benchmark Terminal-Bench 2.1 e perché è importante?

Terminal-Bench 2.1 valuta i modelli su attività reali da terminale e di computer use — il tipo di lavoro agentico in cui un modello deve muoversi in una shell, eseguire comandi, interpretarne l'output e concatenare azioni in più passaggi per raggiungere un obiettivo. È sviluppato dallo stesso team di FrontierBench, che classifica i modelli in base alla capacità di completare attività professionali al computer. Il punteggio dell'87,9% di V4 Pro 0813 su Terminal-Bench è significativo perché misura la capacità del modello di agire come agente autonomo, non solo di rispondere a domande. È la capacità più rilevante per costruire agenti IA in produzione — ed è proprio il benchmark su cui i modelli open-weight sono storicamente rimasti più indietro rispetto ai modelli chiusi di frontiera.

Devo preoccuparmi della data governance usando l'API di DeepSeek?

Con l'API ospitata di DeepSeek, i prompt e la cronologia delle conversazioni transitano sui server di DeepSeek in Cina e sono soggetti alla normativa cinese sui dati, tra cui la legge sulla sicurezza dei dati e la legge sulla protezione delle informazioni personali. Per i settori regolamentati — sanità, finanza, pubblica amministrazione — si tratta di un aspetto sostanziale da valutare rispetto al quadro di data governance della Sua organizzazione. Ospitare in proprio i pesi su licenza MIT su un'infrastruttura al di fuori della Cina elimina il problema del transito dei dati, ma restano due riserve: i pesi disponibili per il self-hosting sono attualmente quelli della preview di aprile (non della build di produzione 0813) e non è stato pubblicato alcun audit di sicurezza indipendente dei pesi di V4 Pro. Le organizzazioni dovrebbero considerare l'API ospitata come esterna al proprio quadro di data governance finché queste condizioni non cambieranno.

L'aumento di prezzo del 16 agosto renderà V4 Pro poco competitivo?

Anche ai nuovi prezzi di picco di 1,32/3,96 dollari per milione di token (un aumento medio ponderato di circa il 264%), V4 Pro resta molto più economico delle alternative di frontiera. Claude Opus 4.8 costa circa 3,85 dollari per milione di token con un rapporto di cache tipico, il che rende V4 Pro circa 3 volte più economico anche ai prezzi di picco — meno dell'attuale divario di 28 volte, ma comunque significativo. Lo sconto del 50% nelle fasce di minor traffico aiuta ulteriormente per i carichi di lavoro batch. Il problema maggiore è la variazione del prezzo dei cache hit: passare da uno sconto del 99% a uno del 97% significa che i cache hit costano ora 12 volte di più, con un impatto sui loop agentici multi-turno che si basano molto sul riutilizzo del contesto. Per i workflow ad alto volume, il consiglio è di concludere le valutazioni dei costi ai prezzi attuali prima del 16 agosto e di strutturare i workflow in modo da sfruttare al massimo le fasce di minor traffico.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h