DeepSeek V4 Pro 0813 GA: Open-Weight-Modell schlägt Opus 4.8 auf Terminal-Bench
TL;DR
DeepSeek-V4-Pro-0813 ist seit dem 13. August 2026 allgemein verfügbar: Aus der April-Preview wurde ein Produktions-Build für App, Web und API. Das Mixture-of-Experts-Modell mit 1,6 Billionen Parametern — davon 49 Milliarden aktiv pro Token — erreicht auf Terminal-Bench 2.1 87,9 % und liegt damit knapp vor Claude Opus 4.8 mit 85,0 %. Zum ersten Mal überholt ein Open-Weight-Modell auf diesem Benchmark ein geschlossenes Frontier-Modell. Unabhängig verifiziert kommt es auf SWE-bench Verified auf 96,40 % und ist damit das bestplatzierte Open-Weight-Modell der Rangliste. Allerdings liegen die GA-Gewichte noch nicht auf Hugging Face, am 16. August tritt eine deutliche Preiserhöhung in Kraft, und mehrere selbst gemeldete Benchmarks warten noch auf eine unabhängige Bestätigung.
Das GA-Release: Was sich tatsächlich geändert hat
DeepSeek hat den V4-Rollout bewusst gestaffelt. Die Modellfamilie erschien zunächst am 24. April 2026 als Open-Weight-Preview, Pro und Flash jeweils unter MIT-Lizenz. Am 31. Juli 2026 wurde zuerst das kleinere Flash-Modell (284 Mrd. Parameter gesamt / 13 Mrd. aktiv) mit offenen Gewichten auf Hugging Face final veröffentlicht. Der Pro-Build sollte „bald folgen" — dieses Versprechen wurde mit dem 0813-Build eingelöst, der am 12. August am API-Endpunkt auftauchte und am 13. August offiziell als GA bestätigt wurde.
Gegenüber der April-Preview bringt das GA-Release vier konkrete Neuerungen:
- Drei Stufen für den Reasoning-Aufwand:
low,highundmax— Entwickler können so Latenz gegen Genauigkeit abwägen - Native Unterstützung der Responses API für agentische Tool-Use-Workflows
- Maximale Ausgabe auf 384K Tokens erweitert (gegenüber dem Limit der Preview)
- DeepSeek Harness (dsh) — ein neues natives Harness für Coding-Agenten, das über Nacht 72.000 GitHub-Sterne sammelte
Was das GA-Release nicht enthielt: aktualisierte offene Gewichte für den 0813-Checkpoint. Im Hugging-Face-Repository liegen weiterhin die Gewichte der April-Preview. Der Produktions-Build ist derzeit nur über API und App nutzbar.
Architektur: MoE in bisher unerreichter Größenordnung
DeepSeeks Wette auf Mixture-of-Experts (MoE) erreicht in V4 Pro ihre bislang extremste Ausprägung. Das Modell umfasst 1,6 Billionen Parameter, aktiviert aber nur rund 49 Milliarden pro Token — eine Aktivierungsquote von 3 %, die die Inferenzkosten im Rahmen hält und jedem Token dennoch Zugriff auf spezialisierte Experten-Netze gibt.
Zu den wichtigsten Architektur-Neuerungen gehören:
- Hybrides Attention-System: kombiniert Compressed Sparse Attention mit Heavily Compressed Attention für effiziente Verarbeitung langer Kontexte
- Manifold-Constrained Hyper-Connections — ein neuartiger Routing-Mechanismus für die Expertenauswahl
- Muon-Optimizer — im Training eingesetzt für bessere Konvergenz
- Effizienzgewinne: Bei 1 Mio. Tokens Kontext benötigt V4 Pro nur 27 % der Inferenz-FLOPs pro Token und 10 % des KV-Cache-Speichers von DeepSeek V3.2
Die Architektur teilt sich V4 Pro mit V4 Flash, allerdings drastisch hochskaliert. Beide Modelle unterstützen ein Kontextfenster von 1 Mio. Tokens — rund 1.500 DIN-A4-Seiten Text.
Benchmark-Ergebnisse: Wo V4 Pro gewinnt
Der 0813-Build zeigt gegenüber der April-Preview deutliche Zugewinne, vor allem bei agentischen Fähigkeiten. Das Gesamtbild:
Selbst gemeldete Benchmarks (DeepSeeks eigene Auswertung)
| Benchmark | April-Preview | V4 Pro 0813 | Delta |
|---|---|---|---|
| Terminal-Bench 2.1 | 72,1 % | 87,9 % | +15,8 |
| DeepSWE | 12,8 % | 62,7 % | +49,9 |
| NL2Repo | 38,5 % | 61,5 % | +23,0 |
| CyberGym | 52,7 % | 83,3 % | +30,6 |
| Toolathlon Verified | 55,9 % | 74,1 % | +18,2 |
| AutomationBench | 12,8 % | 31,8 % | +19,0 |
| DSBench-FullStack | — | 71,1 % | — |
| DSBench-Hard | — | 67,2 % | — |
Unabhängig verifizierte Ergebnisse
Vals.ai hat V4 Pro 0813 durch seine unabhängige Evaluierungspipeline geschickt und bestätigt:
- SWE-bench Verified: 96,40 % — Platz 2 von 82 Modellen, bestplatziertes Open-Weight-Modell der Rangliste (vor Kimi K3 mit 93,40 %)
- Vals Index: 52,37 % — Platz 18 von 46 Modellen, 9,48 Punkte mehr als DeepSeek V4 (42,89 %)
- Kosten pro Test: 0,02 US-Dollar — gegenüber 1,29 US-Dollar für Claude Opus 5 bei 97,00 %
Artificial Analysis bewertet V4 Pro 0813 mit 53 Punkten im Intelligence Index — damit ist es das zweitintelligenteste Open-Weight-Modell, das dort bisher getestet wurde. Zudem arbeitet es tokeneffizienter als die April-Version und benötigt im Index rund 30 % weniger Ausgabe-Tokens.
Das Center for AI Standards and Innovation (CAISI) des NIST liefert den Datenpunkt auf staatlicher Ebene. Im April 2026 hat es die V4-Pro-Preview unabhängig auf neun Benchmarks in fünf Domänen evaluiert, darunter zwei nicht öffentliche Tests, die gegen Kontamination geschützt sein sollen:
„Laut DeepSeeks Daten ist DeepSeek V4 etwa so leistungsfähig wie Opus 4.6 und GPT-5.4, die rund zwei Monate zuvor erschienen sind. Die Evaluierungen von CAISI, die auch nicht öffentliche Benchmarks umfassen, deuten jedoch darauf hin, dass DeepSeek V4 ähnlich abschneidet wie GPT-5, das rund acht Monate zuvor erschienen ist." — NIST CAISI, Evaluation of DeepSeek V4 Pro
Der Abstand ist nicht gleichmäßig verteilt, und er wurde am April-Preview-Build gemessen, nicht am 0813-Checkpoint. Wie viel davon das Post-Training geschlossen hat, ist deshalb die offene Frage. Aufschlussreich ist, wo die Lücke am größten ist: 32 % auf CTF-Archive-Diamond gegenüber 71 % für GPT-5.5 im Bereich Cybersicherheit und 46 % auf dem semi-privaten ARC-AGI-2-Set gegenüber 79 % beim abstrakten Schlussfolgern — während Mathematik nahezu auf Frontier-Niveau liegt.
Die Terminal-Bench-Schlagzeile
Hier wird es interessant. Auf Terminal-Bench 2.1 — dem Benchmark für reale Terminal- und Computer-Use-Aufgaben — erreicht V4 Pro 0813 87,9 %, im Vergleich zu:
- Claude Opus 4.8: 85,0 %
- Claude Fable 5: 88,0 %
- V4 Flash 0731: 82,7 %
- GLM-5.2: 81,0 %
V4 Pro schlägt nicht nur Opus 4.8 — es liegt fast gleichauf mit Claude Fable 5, dem neuesten Modell von Anthropic. Für ein Open-Weight-Modell zu einem Bruchteil der Kosten ist das ein bedeutender Meilenstein.
V4 Pro vs. Claude Opus 4.8: Der vollständige Vergleich
Die Schlagzeile lautet „schlägt Opus 4.8 auf Terminal-Bench", das Gesamtbild ist aber differenzierter. Keines der beiden Modelle ist durchweg besser — die Siege verteilen sich auf unterschiedliche Fähigkeiten.
| Dimension | DeepSeek V4 Pro 0813 | Claude Opus 4.8 |
|---|---|---|
| Terminal-Bench 2.1 | 87,9 % | 85,0 % |
| LiveCodeBench | 93,5 % | 88,8 % |
| SWE-bench Verified | 96,40 % | 97,00 % |
| SWE-bench Pro | 55,4 % | 69,2 % |
| AA Intelligence Index | 52–53 | 57–61 |
| Kosten (pro Mio. Ausgabe-Tokens) | 0,87 $ | 25,00 $ |
| Geschwindigkeit (Tokens/Sek.) | 72,4 | 55,7 |
| Zeit bis zum ersten Token | 1,77 s | 30,22 s |
| Kontextfenster | 1 Mio. | 1 Mio. |
| Max. Ausgabe-Tokens | 384K | — |
| Offene Gewichte | MIT (nur Preview) | Geschlossen |
Das Muster ist eindeutig: DeepSeek gewinnt bei Kosten, Geschwindigkeit, algorithmischem Coding und Terminal-Aufgaben. Opus 4.8 gewinnt bei Software-Engineering auf Repository-Ebene, allgemeiner Intelligenz und Zuverlässigkeit. Der 28-fache Preisunterschied macht V4 Pro zur Standardwahl für Batch-Verarbeitung, Coding-Schleifen mit hohem Volumen und kostensensible agentische Workflows.
Die Open-Weight-Frage
Hier wird die Geschichte kompliziert. DeepSeek hat sich seinen Ruf mit Open-Weight-Releases aufgebaut, und die V4-Familie wurde mit MIT-lizenzierten Gewichten angekündigt. Doch es gibt einen Haken:
- V4 Flash 0731: Die Gewichte sind unter MIT-Lizenz auf Hugging Face verfügbar. Schon heute selbst hostbar.
- V4 Pro 0813 (GA): Die Gewichte sind NICHT veröffentlicht. Das Hugging-Face-Repository zeigt weiterhin den Checkpoint der April-Preview.
Teams, die aus Gründen der Data Governance auf Self-Hosting setzen, betreiben also derzeit die April-Preview, nicht den Produktions-Build. DeepSeek hat nicht ausdrücklich erklärt, wann (oder ob) die 0813-Gewichte veröffentlicht werden. Die Entscheidung deutet auf einen möglichen strategischen Schwenk hin zur Monetarisierung des Flaggschiffmodells über die API.
Für regulierte Branchen ist das relevant. Die gehostete API überträgt Daten an DeepSeeks Server in China und unterwirft sie damit chinesischem Datenrecht. Wer die MIT-lizenzierten Gewichte auf Infrastruktur außerhalb Chinas selbst hostet, beseitigt das Problem der Datenübertragung — allerdings nur, wenn diese Gewichte tatsächlich dem Produktions-Checkpoint entsprechen.
Preise: Die gute und die schlechte Nachricht
Aktuelle Preise (bis 15. August 2026)
DeepSeek bietet V4 Pro 0813 zu denselben Preisen an wie das frühere Preview-Modell:
- Input: 0,435 US-Dollar pro Million Tokens
- Output: 0,87 US-Dollar pro Million Tokens
- Cache-Treffer: ca. 0,004 US-Dollar pro Million Tokens (99 % Rabatt)
Spitzenpreise (ab 16. August 2026)
Am 16. August tritt eine deutliche Neustrukturierung in Kraft:
- Input: 1,32 US-Dollar pro Million Tokens (+204 %)
- Output: 3,96 US-Dollar pro Million Tokens (+355 %)
- Cache-Treffer: 0,044 US-Dollar pro Million Tokens (97 % Rabatt, aber 12-mal teurer als zuvor)
- Nebenzeiten: 50 % Rabatt auf alle Stufen
Die gemittelte Preiserhöhung liegt bei rund 264 %. Selbst zu Spitzenpreisen bleibt V4 Pro deutlich günstiger als Claude Opus 4.8 (3,85 US-Dollar pro Mio. Tokens bei einem Cache-Verhältnis von 7:2:1). Das Zeitfenster für „absurd günstige Frontier-Intelligenz" schließt sich jedoch.
Das 24-Stunden-Duell: V4 Pro vs. GLM-5.3
DeepSeek war nicht das einzige chinesische Labor, das in dieser Woche Frontier-Modelle ausgeliefert hat. Zhipu veröffentlichte GLM-5.3 am 14. August 2026 — genau 24 Stunden nach dem GA von V4 Pro — mit einer völlig anderen Philosophie:
| Dimension | V4 Pro 0813 | GLM-5.3 |
|---|---|---|
| Architektur | Neues 1,6T-MoE, 49B aktiv | Gleiche 743B-Basis wie GLM-5.2 |
| Gewichte | MIT (nur Preview) | Offen in ca. 2 Wochen nach Sicherheitsprüfung |
| SWE-bench Verified | 96,40 % | Noch nicht gemeldet |
| CyberGym | 83,3 % | 84,5 % |
| AutomationBench | 31,8 % | 48,2 % |
| Max. Ausgabe | 384K | 128K |
| API-Preise | 0,435 $/0,87 $ (steigend auf 1,32 $/3,96 $) | Abo 18–168 $/Monat, API noch offen |
Beide beanspruchen die Coding-Krone unter den Open-Weight-Modellen. V4 Pro dominiert bei SWE-bench Verified und reiner Größe. GLM-5.3 liegt bei agentischen Benchmarks vorn und behält dieselbe Architektur mit erweitertem Post-Training bei. Der Wettbewerb treibt beide Labore dazu, schneller und günstiger zu liefern.
Was das für Entwickler bedeutet
Wann V4 Pro 0813 die richtige Wahl ist
- Algorithmische und Wettbewerbsprogrammierung — LiveCodeBench mit 93,5 % schlägt Opus 4.8
- Terminal- und Computer-Use-Agenten — Terminal-Bench 2.1 mit 87,9 % führt das Open-Weight-Feld an
- Batch-Verarbeitung mit hohem Volumen — bei 28-fach niedrigeren Kosten als Opus spricht die Wirtschaftlichkeit für sich
- Reasoning über lange Kontexte — 1 Mio. Tokens Kontext mit 384K Ausgabe eignet sich ideal für Pipelines zur Dokumentenanalyse
- Kostensensible agentische Schleifen — Cache-Preise nahe null machen Multi-Turn-Agenten bezahlbar
Wann Sie bei Opus 4.8 bleiben sollten
- Refactoring auf Repository-Ebene — der Abstand auf SWE-bench Pro beträgt 13,8 Punkte (69,2 % vs. 55,4 %)
- Agentische Arbeit über mehrere Dateien — bei Aufgaben, die vier oder mehr Dateien betreffen, wächst der Abstand weiter
- Enterprise-SLAs und Support — die Zuverlässigkeitszusagen von Anthropic bleiben unerreicht
- Data Governance — wenn Sie keine in China gehostete API nutzen dürfen und die offenen Gewichte nicht aktuell sind
Wann Sie Alternativen in Betracht ziehen sollten
- Self-Hosting: V4 Flash 0731 ist derzeit das einzige DeepSeek-Modell mit verfügbaren GA-Gewichten
- Mehrsprachigkeit über Mandarin/Englisch hinaus: Die AA-Index-Werte von V4 Pro zeigen eine unterdurchschnittliche Abdeckung weiterer Sprachen
- Cybersicherheitsaufgaben: Die NIST-Evaluierung des Preview-Builds ergab 32 % gegenüber 71 % für GPT-5.5 auf CTF-Archive-Diamond
Die Verifizierungslücke
DeepSeeks eigene Auswertungstabelle zeigt beeindruckende Zahlen, doch einige Vorbehalte bleiben:
- Die Vergleichsbasis ist selbstbezogen: Die meisten Zugewinne werden an DeepSeeks eigener April-Preview gemessen, nicht an Wettbewerbern
- Unabhängige Prüfungen sind lückenhaft: Vals.ai hat SWE-bench Verified bestätigt, andere Benchmarks stammen weiterhin vom Anbieter selbst — ein wiederkehrendes Problem bei der Bewertung von KI-Modellen
- Die NIST-Evaluierung betrifft den Preview-Build: Ob 0813 die Lücken bei Cybersicherheit und abstraktem Schlussfolgern geschlossen hat, ist unbekannt
- Kein Sicherheitsaudit der Gewichte: Ein namentlich benanntes, unabhängiges Sicherheitsaudit von V4 Pro wurde bisher nicht veröffentlicht
Die Open-Weight-Community unterzieht diese Angaben bereits einem Härtetest. Der Thread auf Reddit r/LocalLLaMA zeigt ein gemischtes Echo — Begeisterung über die Benchmark-Sprünge, Skepsis wegen der fehlenden GA-Gewichte und Diskussionen darüber, ob die selbst gemeldeten Zahlen einer Replikation durch die Community standhalten.
FAQ
Ist DeepSeek V4 Pro 0813 tatsächlich Open Source?
DeepSeek V4 Pro wurde mit MIT-lizenzierten Gewichten angekündigt, und der Checkpoint der April-Preview ist auf Hugging Face verfügbar. Die Gewichte des 0813-GA-Builds wurden jedoch nicht veröffentlicht — öffentlich sind nur die Gewichte der April-Preview. Sie können also heute das Preview-Modell selbst hosten, nicht aber den Produktions-Build, der die vielbeachteten Benchmark-Ergebnisse erzielt hat. DeepSeek hat nicht erklärt, wann oder ob die 0813-Gewichte veröffentlicht werden. Das deutet auf eine mögliche Abkehr vom traditionell offenen Ansatz hin zu einer API-zentrierten Monetarisierung des Flaggschiffmodells.
Wie schneidet V4 Pro 0813 bei Coding-Aufgaben im Vergleich zu Claude Opus 4.8 ab?
Der Vergleich hängt stark von der Art der Coding-Aufgabe ab. Auf SWE-bench Verified (Behebung einzelner Bugs) erreicht V4 Pro unabhängig verifiziert 96,40 % und liegt damit fast gleichauf mit den 97 % von Opus 4.8. Auf SWE-bench Pro (Engineering über mehrere Dateien auf Repository-Ebene) führt Opus 4.8 mit 13,8 Punkten Vorsprung: 69,2 % gegenüber 55,4 %. Beim algorithmischen Coding (LiveCodeBench) gewinnt V4 Pro mit 93,5 % gegenüber 88,8 %. Auf Terminal-Bench 2.1 (reale Terminal-Aufgaben) liegt V4 Pro mit 87,9 % gegenüber 85,0 % knapp vorn. Praktische Empfehlung: Algorithmische Aufgaben und Arbeit an einzelnen Dateien an V4 Pro geben, Opus für komplexes Refactoring über mehrere Dateien reservieren.
Welche Hardware brauche ich, um DeepSeek V4 Pro selbst zu hosten?
Für V4 Pro in voller Präzision ist wegen der 1,6 Billionen Parameter Multi-GPU-Hardware der H100- oder H200-Klasse nötig. Auch wenn pro Token nur 49 Milliarden Parameter aktiv sind, muss die gesamte Gewichtsmatrix in den Speicher geladen werden. Das kleinere V4 Flash (284 Mrd. gesamt / 13 Mrd. aktiv) läuft quantisiert auf einer einzelnen GPU mit 80 GB. Community-Quantisierungen von Unsloth reichen von einer 3-Bit-Version mit 103 GB bis zu einem verlustfreien 8-Bit-GGUF mit 162 GB. Für Teams ohne Multi-GPU-Infrastruktur bleibt die gehostete API zu 0,435/0,87 US-Dollar pro Million Tokens (Preise vor dem 16. August) der praktikable Zugang.
Was ist der Benchmark Terminal-Bench 2.1 und warum ist er wichtig?
Terminal-Bench 2.1 bewertet Modelle anhand realer Terminal- und Computer-Use-Aufgaben — also agentischer Arbeit, bei der ein Modell sich in einer Shell zurechtfinden, Befehle ausführen, Ausgaben interpretieren und mehrstufige Aktionen verketten muss, um ein Ziel zu erreichen. Entwickelt wird er vom selben Team wie FrontierBench, das Modelle danach einstuft, wie gut sie professionelle Computerarbeit erledigen. Dass V4 Pro 0813 auf Terminal-Bench 87,9 % erreicht, ist bedeutsam, weil der Benchmark die Fähigkeit prüft, als autonomer Agent zu handeln, statt nur Fragen zu beantworten. Genau diese Fähigkeit ist für den Bau produktiver KI-Agenten am relevantesten — und genau auf diesem Benchmark lagen Open-Weight-Modelle bisher am weitesten hinter geschlossenen Frontier-Modellen zurück.
Muss ich mir bei der Nutzung der DeepSeek-API Sorgen um Data Governance machen?
Bei Nutzung der gehosteten DeepSeek-API gelangen Prompts und Gesprächsverläufe auf DeepSeeks Server in China und unterliegen chinesischem Datenrecht, darunter dem Datensicherheitsgesetz und dem Gesetz zum Schutz personenbezogener Informationen. Für regulierte Branchen — Gesundheitswesen, Finanzen, öffentliche Verwaltung — ist das ein wesentlicher Faktor, der anhand des Data-Governance-Rahmens Ihrer Organisation bewertet werden sollte. Wer die MIT-lizenzierten Gewichte auf Infrastruktur außerhalb Chinas selbst hostet, beseitigt das Problem der Datenübertragung, doch zwei Vorbehalte bleiben: Die selbst hostbaren Gewichte sind derzeit die der April-Preview (nicht des 0813-Produktions-Builds), und ein unabhängiges Sicherheitsaudit der V4-Pro-Gewichte wurde bisher nicht veröffentlicht. Organisationen sollten die gehostete API so lange als außerhalb ihres Data-Governance-Rahmens betrachten, bis sich diese Bedingungen ändern.
Macht die Preiserhöhung zum 16. August V4 Pro unattraktiv?
Selbst zu den neuen Spitzenpreisen von 1,32/3,96 US-Dollar pro Million Tokens (eine gemittelte Erhöhung um rund 264 %) bleibt V4 Pro deutlich günstiger als Frontier-Alternativen. Claude Opus 4.8 kostet bei einem typischen Cache-Verhältnis rund 3,85 US-Dollar pro Million Tokens; V4 Pro ist damit selbst zu Spitzenpreisen etwa dreimal günstiger — weniger als der aktuelle 28-fache Abstand, aber immer noch erheblich. Der Rabatt von 50 % zu Nebenzeiten hilft zusätzlich bei Batch-Workloads. Schwerer wiegt die Änderung bei den Cache-Preisen: Der Rabatt sinkt von 99 % auf 97 %, Cache-Treffer kosten damit 12-mal mehr — das trifft Multi-Turn-Agentenschleifen, die stark auf wiederverwendeten Kontext setzen. Für Workflows mit hohem Volumen lautet die Empfehlung, Preisbewertungen noch vor dem 16. August auf Basis der aktuellen Preise abzuschließen und Workflows so zu strukturieren, dass sie Nebenzeiten maximal nutzen.
Quellen
- Artificial Analysis — V4 Pro 0813 Intelligence Index
- Vals.ai — DeepSeek V4 Pro 0813 Independent Evaluation
- YottaLabs — DeepSeek V4: Release Date, Specs, and How to Access It
- TechTimes — DeepSeek V4 Pro 0813 Goes GA: Benchmark Claims Await Independent Proof
- GMI Cloud — DeepSeek V4 Pro Steps Out of Preview: The 0813 Build Is Live
- Hugging Face — DeepSeek V4 Pro GA Release Analysis
- OpenRouter — DeepSeek V4 Pro 0813 API & Pricing
- Totalum — DeepSeek V4 Pro vs Claude 2026: Coding Agent Showdown
- CodingFleet — Claude Opus 4.8 vs DeepSeek V4 Pro
- BenchLM — Claude Opus 4.8 vs DeepSeek V4 Pro 0813 Comparison
- Artificial Analysis — Opus 4.8 vs V4 Pro Comparison
- Kaitchup — DeepSeek V4 Pro 0813 Architecture Details
- LLM-Stats — V4 Flash 0731 vs V4 Pro 0813 Benchmark Comparison
- Medium — DeepSeek V4 Pro 0813: The 1.6 Trillion Parameter MoE
- Flowtivity — GLM-5.3 vs DeepSeek V4-Pro: The 24-Hour Showdown
- Pristren — DeepSeek V4 and Kimi K2.6 vs Claude Opus 4.8
- Unsloth — DeepSeek-V4: How to Run Locally
- Reddit r/LocalLLaMA — V4-Pro-0813 Benchmarks Discussion
- chat-deep.ai — DeepSeek V4 Pro vs Flash, API, Pricing & Download
- NIST CAISI — Evaluation of DeepSeek V4 Pro