DeepSeek V4.1 Flash: secondo Flash di fila — 400 tok/s, multimodalità nativa e il taglio prezzi del 10.09 come artefatto di costo

DeepSeek V4.1 Flash: il secondo modello Flash in una settimana — con una nuova fascia di prezzo (peak/off-peak), la multimodalità nativa e il reindirizzamento del piano Pro al prezzo Flash dal 14 settembre.

DeepSeek V4.1 Flash: secondo Flash di fila — 400 tok/s, multimodalità nativa e il taglio prezzi del 10.09 come artefatto di costo

DeepSeek V4.1 Flash: secondo Flash di fila — 400 tok/s, multimodalità nativa e il taglio prezzi del 10.09 come artefatto di costo

TL;DR: Il 10 settembre 2026 DeepSeek ha pubblicato V4.1 Flash — il secondo modello Flash in una settimana, di nuovo una build temporanea con successore stabile. Per chi costruisce non è una questione di classifica ma di calcolo: i prezzi per milione di token sono scesi in modo netto, il vecchio piano Pro dal 14 settembre viene reindirizzato alla tariffa Flash e ogni workload in cache ne beneficia. Chi lavora con model ID fissi deve d'ora in poi osservare la data del prossimo identificatore stabile.

Il nocciolo in sintesi

DeepSeek-V4.1-FlashDeepSeek-V4-Flash (vecchio)
Prezzo per milione di token$0.003 (cache-hit) / $0.15 (cache-miss) / $0.60 (output)$0.007 / $0.22 / $0.66
In vigore dal10.09.2026, 04:00 UTC21.08.2026
Stato della buildstabile, nome API ufficialetemporanea, sostituita da V4.1
Multimodalesì — comprensione nativa delle immagini

DeepSeek-V4.1-Flash è il successore nello stack Flash: stesso modello, più token per dollaro, e il piano Pro ottiene lo stesso prezzo tramite il reindirizzamento. Chi fissa deepseek-flash incamera automaticamente il risparmio.

Le due fasce di prezzo nel dettaglio

La tariffa off-peak costa esattamente metà della peak. DeepSeek definisce il picco come 01:00–04:00 UTC e 06:00–10:00 UTC, dal lunedì al venerdì. In numeri:

PeakOff-peak
Input (cache-hit)$0.006$0.003
Input (cache-miss)$0.30$0.15
Output$1.20$0.60

Per un semplice cache-miss di 10K token più 2K di output: circa $0,03 in peak, $0,015 in off-peak. La vecchia tabella V4 (agosto 2026) era ancora a $0,22/$0,44 per i cache-miss e $0,66/$1,32 per l'output. Il risparmio tocca quindi non solo i carichi nuovi ma anche quelli già in cache.

La meccanica di reindirizzamento dal 14 settembre

La leva decisiva non è solo il nuovo listino ma ciò che fa sul piano Pro. Dal 14 settembre 2026, 04:00 UTC (12:00 Pechino), DeepSeek instrada automaticamente ogni richiesta a deepseek-v4-pro su V4.1-Flash. Il piano Pro di fatto scompare dietro il prezzo Flash:

  • Input cache-miss: da $0,66 a $0,15 — circa il 77% in meno.
  • Output: da $1,98 a $0,60 — circa il 70% in meno.

I modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp sono ritirati e reindirizzano a deepseek-flash. Chi ha ID fissi vede dunque quattro nomi di modello cambiare alle proprie spalle senza toccare il codice.

Costo per task: l'artefatto numerico

Il modo più semplice per vedere l'effetto è un piccolo calcolo. Esempio: un task di supporto con 10.000 token di input cache-miss e 2.000 token di output.

Parametro del taskVecchio (agosto 2026)Nuovo (dal 10.09.)
Costo in peak~$0,0106~$0,0030
Costo in off-peak~$0,0053~$0,0015

Con due batch da 1 milione di token — uno in peak e uno in off-peak — i risparmi sommano a circa 17 dollari per milione. È questo il numero che appartiene alla tabella decisionale.

Cosa significa per il proprio stack

Le note di rilascio descrivono V4.1-Flash come un modello piccolo della nuova famiglia architetturale con unità nativa di comprensione visiva; le tabelle ufficiali DeepSeek indicano 221–235 tok/s, run indipendenti come WorldofAI riportano fino a 400 tok/s in base all'hardware. Il contesto da 1M token resta, l'output massimo è 384K.

La regola decisionale per questa settimana:

  • Fissi deepseek-v4-pro? Dal 14 settembre ottieni automaticamente la tariffa Flash. Da verificare: nel codice ci sono ancora vecchi assunzioni di costo Pro?
  • Fissi deepseek-flash? Risparmi subito. Da verificare: il rapporto di cache-hit è abbastanza alto perché scatti la tariffa cache-hit?
  • Confronti entrambi i modelli: calcola le fasce separatamente — 01:00–04:00 e 06:00–10:00 UTC costano il doppio, tutto il resto metà.

Setup multi-modello: deepseek-v4-flash e deepseek-v4-flash-vision-exp non esistono più come ID separati — entrambi i nomi reindirizzano a deepseek-flash. Chi ha una lista di modelli hardcodata vedrà una riga in meno del previsto.

Modelli locali: la famiglia V4.1 è una MoE da 552B con 8B di parametri attivi in input e 16B in output, MXFP4, circa 510 GB di footprint su disco per lo stack completo, licenza MIT. L'opzione di inferenza locale resta; la domanda è il proprio slot GPU.

FAQ

Quando esattamente il nuovo prezzo Flash è entrato in vigore? I prezzi sono attivi dal rilascio di V4.1-Flash del 10 settembre 2026, 04:00 UTC. Da quel momento deepseek-flash è il nome del modello in API. I vecchi nomi funzionano da allora come redirect sulla nuova build.

Che fine fa il piano Pro dopo il 14 settembre? Il piano Pro viene reindirizzato automaticamente a V4.1-Flash e fatturato ai prezzi Flash: in concreto il 77% di costo in meno per l'input cache-miss e circa il 70% per l'output. Una nuova generazione Pro arriva solo con il rilascio di V4.1 Pro.

Come sono definite peak e off-peak? Le ore di picco sono 01:00–04:00 e 06:00–10:00 UTC nei giorni feriali. Tutte le altre ore sono off-peak, a esattamente metà prezzo. Una leva semplice: spostare l'elaborazione a batch nelle finestre off-peak e lasciare in peak solo le richieste critiche per latenza.

Perché due indicazioni di throughput diverse? Le tabelle ufficiali DeepSeek indicano 221–235 tok/s per V4.1-Flash. Run di terze parti come il test WorldofAI riportano fino a 400 tok/s in base a hardware e dimensione del prompt. Per il calcolo dei costi conta il range ufficiale; il numero 400 è il caso migliore di un singolo test.

Che rapporto c'è con i setup GGUF locali? La variante GGUF di Qwen3.8-27B da 11,8 GB resta un punto separato nello stesso scenario di prezzi: gli stack locali sono limitati allo slot da 16 GB, e i prezzi API sono ora l'ancora. Chi combina entrambi scriva la regola off-peak direttamente nella tabella di scheduling dei run API.

Fonti

Condividi articolo

Share: