Tecnologia & AIKimi K2.7 vs DeepSeek V4 (2026): coding open-weight dopo Kimi K3 e V4-Flash-0731
Kimi K2.7 vs DeepSeek V4 nel 2026: prezzi OpenRouter aggiornati, punteggi Kimi K3 verificati da ARC e V4-Flash-0731 con licenza MIT.
Attualità del rilascioValidazione indipendente dei benchmarkCosto dell'APIMCP e uso agentico degli strumenti
Anteprima del verdettoNon c'è ancora un vincitore unico, ma l'equilibrio si è spostato dalla prima stesura di questa pagina — e si è spostato su entrambi i lati nello stesso momento. DeepSeek è ora il default più solido per quasi ogni decisione di produzione sensibile al costo. Ai prezzi OpenRouter attuali deepseek-v4-flash-0731 costa 0,14 $/M in input e 0,28 $/M in output contro 0,67 $/3,40 $ di kimi-k2.7-code, cioè circa 12 volte meno in output, ed espone una finestra da 1.310.720 token contro i 262.144 di K2.7 — il pareggio che questa pagina registrava sul contesto era semplicemente errato. La build 0731 è inoltre il peso aperto più recente del confronto (304B, 167 GB, scheda aggiornata il 01/08/2026) ed esce con licenza MIT semplice, mentre la scheda di Kimi K3 dichiara license: other con license_name: kimi-k3. Per chi ospita, affina o ridistribuisce, quella sola riga di licenza è già una decisione.
Ciò che è cambiato a favore di Moonshot è la validazione — ma non per il modello che questa pagina nomina. ARC Prize ha verificato Kimi K3 il 31 luglio 2026 con 94,5% su ARC-AGI-1 Semi-Private e 60,4% su ARC-AGI-2, i punteggi open-weight più alti mai registrati. I guadagni di coding di Kimi K2.7 Code restano invece auto-riportati sul Kimi Code Bench v2 di Moonshot. La lettura onesta è quindi: la linea Kimi si è guadagnata credibilità indipendente, e la si incassa passando a K3, non restando su K2.7. K2.7 Code mantiene un vantaggio reale esattamente dove questa pagina lo ha sempre collocato: uso MCP degli strumenti (76,0 MCP Atlas, 81,1 MCP Mark Verified), throughput (180-260 token/s sulla variante HighSpeed) e consumo di token di ragionamento inferiore di circa il 30% rispetto a K2.6.
La constatazione più utile per chi instrada davvero il traffico è che la scelta fra queste due famiglie non è la leva principale. I numeri di ARC Prize mostrano Kimi K3 scendere da 60,4% a 12,4% su ARC-AGI-2 solo perché lo sforzo di ragionamento passa da max a low, e Simon Willison riporta la stessa forma sull'altro lato: V4-Flash-0731 gli ha dato un risultato deludente al livello predefinito e uno molto migliore con reasoning_effort high. Uno scarto di accuratezza di cinque volte dentro un modello è maggiore della distanza fra i due modelli. Valuti un candidato al livello di sforzo che pagherà davvero, altrimenti il prezzo di listino è finzione.
Lo schema di Context Studios resta uguale nella forma e più preciso nel dettaglio: instradare per default il coding delimitato ad alto volume su DeepSeek V4-Flash-0731 per costo e contesto, scalare i casi di ragionamento più duri su V4-Pro e indirizzare i loop agentici a forte orchestrazione MCP sulla linea Kimi — pianificando però su Kimi K3 anziché K2.7, dato che K3 è il termine verificato di quel percorso, e fissando il livello di sforzo di ragionamento nella stessa configurazione in cui si fissa il modello. In più, il 21/08/2026 DeepSeek ha rilasciato DeepSeek-V4-Flash-Vision-Exp — un modello API multimodale sperimentale (testo + immagine) con prestazioni testuali paragonabili a V4 Flash, listato su OpenRouter a 0,22 $/M in input e 0,66 $/M in output con contesto da 1M. Ciò estende i casi di produzione di V4 Flash al lavoro agentico visivo (screenshot, interfacce, diagrammi) a una frazione del costo dei modelli multimodali di frontiera. Dallo snapshot del 10.09.2026 il lato DeepSeek si è mosso: V4-Flash-0731 dimezza a 0,065/0,18 $ per milione di token, il divario di output con kimi-k2.7-code (~0,71/3,50 $) sale a ~19x; è segnalato un build V4.1 Flash (multimodale nativo, ~400 tok/s, fino al 10.09) non ancora su OpenRouter. La formula di routing resta: V4-Flash per il volume, V4-Pro per il ragionamento difficile, la linea Kimi per i loop MCP, con K3 come estremità verificata.
Al confronto →