DeepSeek V4.1 Flash: secondo Flash di fila — 400 tok/s, multimodalità nativa e il taglio prezzi del 10.09 come artefatto di costo
TL;DR: Il 10 settembre 2026 DeepSeek ha pubblicato V4.1 Flash — il secondo modello Flash in una settimana, di nuovo una build temporanea con successore stabile. Per chi costruisce non è una questione di classifica ma di calcolo: i prezzi per milione di token sono scesi in modo netto, il vecchio piano Pro dal 14 settembre viene reindirizzato alla tariffa Flash e ogni workload in cache ne beneficia. Chi lavora con model ID fissi deve d'ora in poi osservare la data del prossimo identificatore stabile.
Il nocciolo in sintesi
| DeepSeek-V4.1-Flash | DeepSeek-V4-Flash (vecchio) | |
|---|---|---|
| Prezzo per milione di token | $0.003 (cache-hit) / $0.15 (cache-miss) / $0.60 (output) | $0.007 / $0.22 / $0.66 |
| In vigore dal | 10.09.2026, 04:00 UTC | 21.08.2026 |
| Stato della build | stabile, nome API ufficiale | temporanea, sostituita da V4.1 |
| Multimodale | sì — comprensione nativa delle immagini | sì |
DeepSeek-V4.1-Flash è il successore nello stack Flash: stesso modello, più token per dollaro, e il piano Pro ottiene lo stesso prezzo tramite il reindirizzamento. Chi fissa deepseek-flash incamera automaticamente il risparmio.
Le due fasce di prezzo nel dettaglio
La tariffa off-peak costa esattamente metà della peak. DeepSeek definisce il picco come 01:00–04:00 UTC e 06:00–10:00 UTC, dal lunedì al venerdì. In numeri:
| Peak | Off-peak | |
|---|---|---|
| Input (cache-hit) | $0.006 | $0.003 |
| Input (cache-miss) | $0.30 | $0.15 |
| Output | $1.20 | $0.60 |
Per un semplice cache-miss di 10K token più 2K di output: circa $0,03 in peak, $0,015 in off-peak. La vecchia tabella V4 (agosto 2026) era ancora a $0,22/$0,44 per i cache-miss e $0,66/$1,32 per l'output. Il risparmio tocca quindi non solo i carichi nuovi ma anche quelli già in cache.
La meccanica di reindirizzamento dal 14 settembre
La leva decisiva non è solo il nuovo listino ma ciò che fa sul piano Pro. Dal 14 settembre 2026, 04:00 UTC (12:00 Pechino), DeepSeek instrada automaticamente ogni richiesta a deepseek-v4-pro su V4.1-Flash. Il piano Pro di fatto scompare dietro il prezzo Flash:
- Input cache-miss: da $0,66 a $0,15 — circa il 77% in meno.
- Output: da $1,98 a $0,60 — circa il 70% in meno.
I modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp sono ritirati e reindirizzano a deepseek-flash. Chi ha ID fissi vede dunque quattro nomi di modello cambiare alle proprie spalle senza toccare il codice.
Costo per task: l'artefatto numerico
Il modo più semplice per vedere l'effetto è un piccolo calcolo. Esempio: un task di supporto con 10.000 token di input cache-miss e 2.000 token di output.
| Parametro del task | Vecchio (agosto 2026) | Nuovo (dal 10.09.) |
|---|---|---|
| Costo in peak | ~$0,0106 | ~$0,0030 |
| Costo in off-peak | ~$0,0053 | ~$0,0015 |
Con due batch da 1 milione di token — uno in peak e uno in off-peak — i risparmi sommano a circa 17 dollari per milione. È questo il numero che appartiene alla tabella decisionale.
Cosa significa per il proprio stack
Le note di rilascio descrivono V4.1-Flash come un modello piccolo della nuova famiglia architetturale con unità nativa di comprensione visiva; le tabelle ufficiali DeepSeek indicano 221–235 tok/s, run indipendenti come WorldofAI riportano fino a 400 tok/s in base all'hardware. Il contesto da 1M token resta, l'output massimo è 384K.
La regola decisionale per questa settimana:
- Fissi deepseek-v4-pro? Dal 14 settembre ottieni automaticamente la tariffa Flash. Da verificare: nel codice ci sono ancora vecchi assunzioni di costo Pro?
- Fissi deepseek-flash? Risparmi subito. Da verificare: il rapporto di cache-hit è abbastanza alto perché scatti la tariffa cache-hit?
- Confronti entrambi i modelli: calcola le fasce separatamente — 01:00–04:00 e 06:00–10:00 UTC costano il doppio, tutto il resto metà.
Setup multi-modello: deepseek-v4-flash e deepseek-v4-flash-vision-exp non esistono più come ID separati — entrambi i nomi reindirizzano a deepseek-flash. Chi ha una lista di modelli hardcodata vedrà una riga in meno del previsto.
Modelli locali: la famiglia V4.1 è una MoE da 552B con 8B di parametri attivi in input e 16B in output, MXFP4, circa 510 GB di footprint su disco per lo stack completo, licenza MIT. L'opzione di inferenza locale resta; la domanda è il proprio slot GPU.
FAQ
Quando esattamente il nuovo prezzo Flash è entrato in vigore? I prezzi sono attivi dal rilascio di V4.1-Flash del 10 settembre 2026, 04:00 UTC. Da quel momento deepseek-flash è il nome del modello in API. I vecchi nomi funzionano da allora come redirect sulla nuova build.
Che fine fa il piano Pro dopo il 14 settembre? Il piano Pro viene reindirizzato automaticamente a V4.1-Flash e fatturato ai prezzi Flash: in concreto il 77% di costo in meno per l'input cache-miss e circa il 70% per l'output. Una nuova generazione Pro arriva solo con il rilascio di V4.1 Pro.
Come sono definite peak e off-peak? Le ore di picco sono 01:00–04:00 e 06:00–10:00 UTC nei giorni feriali. Tutte le altre ore sono off-peak, a esattamente metà prezzo. Una leva semplice: spostare l'elaborazione a batch nelle finestre off-peak e lasciare in peak solo le richieste critiche per latenza.
Perché due indicazioni di throughput diverse? Le tabelle ufficiali DeepSeek indicano 221–235 tok/s per V4.1-Flash. Run di terze parti come il test WorldofAI riportano fino a 400 tok/s in base a hardware e dimensione del prompt. Per il calcolo dei costi conta il range ufficiale; il numero 400 è il caso migliore di un singolo test.
Che rapporto c'è con i setup GGUF locali? La variante GGUF di Qwen3.8-27B da 11,8 GB resta un punto separato nello stesso scenario di prezzi: gli stack locali sono limitati allo slot da 16 GB, e i prezzi API sono ora l'ancora. Chi combina entrambi scriva la regola off-peak direttamente nella tabella di scheduling dei run API.
Fonti
- Documentazione e changelog DeepSeek: https://api.deepseek.com/docs
- Apidog, quadro dei prezzi (tabelle peak/off-peak): https://apidog.com/blog/deepseek-v4-1-flash-pricing
- Coursiv — metriche V4.1 Flash e redirect: https://coursiv.io/blog/deepseek-v4-1-flash
- CodingFleet — architettura, contesto, output massimo: https://codingfleet.com/blog/deepseek-v4-1-flash-vs-claude-opus-5
- Eesel — sintesi del rilascio: https://www.eesel.ai/blog/deepseek-v4-1-flash
- Verbale di test WorldofAI: https://www.youtube.com/watch?v=T2dnchLabZQ