Die besten Open-Weight-LLMs 2026: Self-Hosting-Guide
Die besten Open-Weight-LLMs für Self-Hosting 2026 im Vergleich: Qwen3.5, GLM-5.2, gpt-oss-120b, DeepSeek-V4, Kimi K2.7 Code, Gemma 4, Mistral Small 4 und MiniMax M3 — geprüfte Parameterzahlen, Kontextlängen, Lizenzen und Hardware-Anforderungen.
TL;DR
Die besten Open-Weight-LLMs 2026 sind Qwen3.5 (breiteste Größenpalette, Apache 2.0), GLM-5.2 (stärkstes selbst hostbares Modell für Coding und Long-Horizon-Agenten, MIT, 1M Kontext), OpenAIs gpt-oss-120b/20b (beste Leistung pro GPU: 117B auf einer einzigen 80-GB-Karte, 21B in 16 GB), DeepSeek-V4 (1,6T/49B aktiv, Frontier-Reasoning bei 1M Kontext), Kimi K2.7 Code (1T/32B Coding-Agent), Gemma 4, Mistral Small 4 und MiniMax M3. Entscheidend sind Hardware-Fit, Kontextlänge und wie permissiv die Lizenz wirklich ist.
Top Picks
Qwen3.5 (Alibaba)
AI-NativeBeste Allround-Familie und der sicherste Standard: dieselbe Architektur erscheint in 0,8B, 2B, 4B, 9B, 27B, 35B-A3B und 122B-A10B — durchgehend unter Apache 2.0. Das Flaggschiff Qwen3.5-122B-A10B aktiviert 10B von 122B Parametern pro Token und liefert nativ 262.144 Token Kontext, erweiterbar auf rund 1M. Allein die 9B-Variante ist derzeit das meistgeladene Open-Weight-LLM auf Hugging Face — das bedeutet die größte Auswahl an Quantisierungen, Fine-Tunes und Serving-Rezepten. Hier anfangen, außer ein konkreter Workload spricht dagegen.
GLM-5.2 (Z.ai / Zhipu)
AI-NativeBestes Open-Weight-Modell für Long-Horizon-Agenten und Coding. GLM-5.2 ist das Sparse-Attention-MoE-Flaggschiff von Z.ai, veröffentlicht unter schlichter MIT-Lizenz, und das erste der GLM-Reihe mit einem belastbaren 1M-Token-Kontext statt eines nominellen. Die IndexShare-Attention nutzt denselben Indexer über je vier Sparse-Layer hinweg und senkt die FLOPs pro Token bei 1M Kontext um den Faktor 2,9 — genau diese Effizienz macht Self-Hosting überhaupt praktikabel. Mehrere unabhängige 2026er-Rankings sehen es an der Spitze der selbst hostbaren Coding-Modelle.
gpt-oss-120b / gpt-oss-20b (OpenAI)
AI-NativeBeste Leistung pro GPU und das am einfachsten produktiv zu bringende Open-Weight-Modell. gpt-oss-120b hat 117B Parameter mit 5,1B aktiv und läuft dank MXFP4-Quantisierung der MoE-Gewichte auf einer einzigen 80-GB-GPU (H100 oder MI300X); gpt-oss-20b hat 21B Parameter mit 3,6B aktiv und passt in 16 GB, also auf Workstation oder High-End-Laptop. Apache 2.0 und feintunebar — das 120b auf einem einzelnen H100-Knoten, das 20b sogar auf Consumer-Hardware. Wenn die Randbedingung "eine GPU, die wir schon haben" lautet, ist die Shortlist genau ein Eintrag lang.
DeepSeek-V4 (Pro / Flash)
AI-NativeBestes Open-Weight-Frontier-Reasoning, sofern der Cluster vorhanden ist. DeepSeek-V4-Pro ist ein MoE mit 1,6T Parametern und 49B aktiv, DeepSeek-V4-Flash hat 284B mit 13B aktiv — beide mit vollem Eine-Million-Token-Kontext unter MIT-Lizenz. Die hybride Attention (Compressed Sparse Attention plus Heavily Compressed Attention) macht den langen Kontext bezahlbar: Bei 1M Token braucht V4-Pro laut Model Card nur rund 27 % der Inferenz-FLOPs pro Token und 10 % des KV-Caches von DeepSeek-V3.2. Pro ist eher Cluster- oder Miet-Sache, Flash die Variante, die Teams realistisch selbst hosten.
Bester Open-Weight-Coding-Agent, wenn das Modell auf die Agenten-Schleife statt auf Chat trainiert sein soll. Kimi K2.7 Code ist ein MoE mit 1T Parametern und 32B aktiv, 384 Experten (8 ausgewählte plus 1 geteilter pro Token) und 256K Kontext, aufgebaut auf K2.6 und primär in Agent-Harnesses statt auf statischen Benchmarks evaluiert. Der Haken: Es erscheint unter einer Modified-MIT-Lizenz, nicht unter reinem MIT oder Apache — die Bedingungen vor dem kommerziellen Einsatz lesen. Ebenfalls relevant: Die vielfach gemeldeten "Kimi K3"-Gewichte waren zum Redaktionsschluss dieses Guides in Moonshots offizieller Hugging-Face-Organisation noch nicht aufgetaucht.
Gemma 4 (Google DeepMind)
AI-NativeBeste Open-Weight-Familie für On-Device und Edge. Gemma 4 erscheint in fünf Größen — E2B, E4B, 12B, 26B-A4B und 31B — als Dense- und MoE-Varianten, mit 256K Kontext, multimodaler Text-und-Bild-Eingabe (Audio bei E2B, E4B und 12B) und Unterstützung für über 140 Sprachen, durchgehend unter Apache 2.0. Der instruktionsgetunte 26B-A4B-Checkpoint gehört zu den meistgeladenen Open-Weight-Modellen auf Hugging Face. Wenn das Ziel ein Smartphone, ein Laptop oder eine On-Prem-Appliance statt eines GPU-Clusters ist, ist diese Familie genau dafür gebaut.
Mistral Small 4 / Mistral Large 3
AI-NativeErste Wahl, wenn EU-Datenresidenz und Souveränität harte Anforderungen sind und keine Wunschliste. Mistral Small 4 hat 119B Parameter mit 6,5B aktiv pro Token, 256K Kontext und einen Per-Request-Parameter reasoning_effort, veröffentlicht unter Apache 2.0; darüber steht Mistral Large 3 (675B), ebenfalls Apache 2.0. Ein europäischer Anbieter mit permissiver Lizenz ist für regulierte DACH-Branchen ein grundlegend anderes Beschaffungsgespräch — und Mistrals Fokus auf Air-Gapped- und Souveränitäts-Deployments macht das Modell dort zum pragmatischen Standard, auch wenn ein chinesisches Lab im Leaderboard höher steht.
Bestes Open-Weight-Modell für Millionen-Token-Workloads mit hohem Durchsatz. MiniMax-M3 ist ein nativ multimodales MoE mit rund 428B Parametern und etwa 23B aktiv, aufgebaut auf MiniMax Sparse Attention (MSA) — laut Model Card 9× schnelleres Prefill und 15× schnelleres Decode gegenüber M2 bei 1M Kontext, mit rund 1/20 der Rechenlast pro Token. Wenn der Engpass das günstige Ausliefern sehr langer Kontexte ist und nicht der Spitzenplatz im Reasoning-Ranking, ist genau dieses Durchsatzprofil der Unterschied. Lizenziert unter MiniMax' eigenen Bedingungen — also Prüfpunkt, nicht Formalie.
Comparison Table
| Name | Am besten für | Architektur & Kontext | Hardware-Fit | Lizenz & Kosten | Voll permissive Lizenz |
|---|---|---|---|---|---|
| Allzweck über die gesamte Größenpalette — eine Familie vom Laptop bis zum Multi-GPU-Knoten | MoE- und Dense-Varianten, 262K Kontext (erweiterbar ~1M), multimodal, vLLM/SGLang/Transformers | Laptop (0,8B–9B) bis 8× GPU-Knoten (122B-A10B) | Kostenlose Gewichte (Apache 2.0); bezahlt werden nur die eigenen GPUs | ||
| Long-Horizon-Agenten und Coding — das stärkste selbst hostbare Coding-Modell 2026 | Sparse-Attention-MoE mit IndexShare, 1M-Token-Kontext, MTP Speculative Decoding, FP8-Build verfügbar | Multi-GPU-Knoten (FP8-Build empfohlen) | Kostenlose Gewichte (MIT); Hosted API über Z.ai, wenn kein Cluster gewünscht ist | ||
| Bester Fit für begrenzte Hardware — starkes Reasoning auf einer einzelnen GPU | MoE mit nativer MXFP4-Quantisierung, Harmony-Response-Format, vLLM/Ollama/llama.cpp | Einzelne 80-GB-GPU (120b) oder 16-GB-Workstation/Laptop (20b) | Kostenlose Gewichte (Apache 2.0), ohne Copyleft- oder Patent-Fallstricke | ||
| Frontier-Reasoning und Dokumentenarbeit im Millionen-Token-Bereich | MoE mit hybrider CSA/HCA-Attention, 1M Kontext, DSpark Speculative Decoding, 32T Pre-Training-Token | Großer Cluster (Pro, 1,6T) oder mittlerer Multi-GPU-Knoten (Flash, 284B) | Kostenlose Gewichte (MIT); für Pro ernsthaftes GPU-Budget oder Hosted Provider nötig | ||
| Agentisches Coding — trainiert für lange, mehrstufige Tool-Use-Sessions | MoE, 1T gesamt / 32B aktiv, 384 Experten, 256K Kontext, SwiGLU | Großer Multi-GPU-Cluster | Kostenlose Gewichte, aber Modified-MIT-Lizenz — vor kommerzieller Nutzung prüfen | ||
| On-Device und Edge — vom Smartphone über Laptops bis zum einzelnen Server | Dense- + MoE-Varianten, 256K Kontext, multimodal (Text/Bild, Audio bei kleinen Größen), 140+ Sprachen | Smartphone/Laptop (E2B–12B) bis Einzelserver (26B-A4B, 31B) | Kostenlose Gewichte (Apache 2.0) | ||
| EU-souveräne und regulierte Deployments — air-gapped, On-Prem, datenresidenzgebunden | 119B / 6,5B aktiv (Small 4), 256K Kontext, Per-Request reasoning_effort, vLLM-ready | Multi-GPU-Knoten (Small 4) bis Cluster (Large 3, 675B) | Kostenlose Gewichte (Apache 2.0); kommerzieller Support und La Plateforme verfügbar | ||
| Long-Context-Serving mit hohem Durchsatz und multimodaler Eingabe | Sparse-Attention-MoE (MSA), ~428B gesamt / ~23B aktiv, 1M Kontext, nativ multimodal | Multi-GPU-Knoten bis Cluster | Kostenlose Gewichte unter MiniMax-Modelllizenz — Bedingungen vor kommerzieller Nutzung prüfen |
← Scroll horizontally to see all columns
How to Choose
- Von der Hardware aus denken, nicht vom Leaderboard. Der nützlichste Filter 2026 lautet: "Was passt auf die GPUs, die wir schon haben?" Eine 80-GB-Karte heißt gpt-oss-120b. Eine 16-GB-Workstation heißt gpt-oss-20b oder eine kleine Qwen3.5-/Gemma-4-Variante. Ein Multi-GPU-Knoten öffnet GLM-5.2, Qwen3.5-122B-A10B, Mistral Small 4 und DeepSeek-V4-Flash. Ein 1,6T-Modell wie DeepSeek-V4-Pro ist eine Cluster- oder Miet-Entscheidung, keine Self-Hosting-Entscheidung.
- Die Lizenz vor den Benchmarks lesen. "Open Weights" ist nicht eine Sache. Apache 2.0 (Qwen3.5, gpt-oss, Gemma 4, Mistral) und MIT (GLM-5.2, DeepSeek-V4) sind tatsächlich permissiv. Modified MIT (Kimi K2.7 Code) und eigene Anbieterlizenzen (MiniMax-M3) enthalten Bedingungen, die spätestens beim Produkt-Launch relevant werden. Die Rechtsabteilung sollte die LICENSE-Datei im Repository prüfen, nicht das Badge auf der Model Card.
- Die beworbene Kontextlänge ist eine Kapazitätsangabe, keine Qualitätsangabe. Nahezu jedes Flaggschiff nennt heute 1M Token. Der Unterschied liegt darin, ob die Attention-Architektur diesen Kontext bezahlbar ausliefert — GLM-5.2 (IndexShare), DeepSeek-V4 (hybrid CSA/HCA) und MiniMax (MSA) existieren genau deshalb. Long-Context-Qualität vor der Cluster-Dimensionierung an den eigenen Dokumenten messen.
- Das Modell auf die Schleife matchen, nicht auf den Durchschnitt. Ein Coding-Agent mit 200 Tool-Calls pro Aufgabe belohnt Modelle, die in einem Agent-Harness nachtrainiert wurden (Kimi K2.7 Code, GLM-5.2). Ein RAG-Endpunkt mit kurzen Antworten bei hohem Volumen belohnt Durchsatz und wenige aktive Parameter (gpt-oss, Qwen3.5-35B-A3B, MiniMax-M3). Das sind zwei verschiedene Anschaffungen.
- Früh auf einen Serving-Stack standardisieren. vLLM und SGLang decken den Multi-GPU-Server ab — PagedAttention, Continuous Batching, Speculative Decoding; Ollama und llama.cpp decken Laptops und Einzel-GPU-Maschinen ab. Erst den Stack wählen, dann das Modell: Dann ist ein späterer Modellwechsel eine Config-Änderung — und genau das ist der Sinn von Open Weights.
- Nicht ein Lock-in gegen das nächste tauschen. Den gesamten Stack auf die Gewichte eines einzigen Labs zu stellen — Meta, Alibaba oder wer auch immer — stellt genau die Abhängigkeit wieder her, wegen der man die API-Anbieter verlassen hat. Ein Gateway oder ein OpenAI-kompatibler Proxy vor den Modellen macht den Wechsel zur Konfigurationsfrage; mindestens eine zweite Modellfamilie sollte auf den eigenen Evals qualifiziert bleiben.
- Releases gegen die Primärquelle prüfen. 2026 haben mehrere Medien Modellgewichte als am angekündigten Termin veröffentlicht gemeldet, während die Hugging-Face-Organisation des Anbieters noch gar kein entsprechendes Repository hatte. Vor einer Migration die Modellliste der Organisation direkt auf Hugging Face prüfen — Drittanbieter-Derivate mit passendem Namen täuschen jede reine Stichwortsuche.
Frequently Asked Questions
Related Resources
Sources & Further Reading
Qwen3.5-122B-A10B — Model Card (Parameter, 262K Kontext, Apache 2.0)
Hugging Face / Alibaba Qwen
GLM-5.2 — Model Card (1M Kontext, IndexShare-Attention, MIT)
Hugging Face / Z.ai
GLM-5.2 — Ankündigung
Z.ai
gpt-oss-120b — Model Card (117B/5,1B aktiv, einzelne 80-GB-GPU, MXFP4, Apache 2.0)
Hugging Face / OpenAI
DeepSeek-V4 — Model Card (1,6T/49B Pro, 284B/13B Flash, 1M Kontext, hybrid CSA/HCA)
Hugging Face / DeepSeek AI
Kimi K2.7 Code — Model Card (1T/32B aktiv, 384 Experten, 256K Kontext, Modified MIT)
Hugging Face / Moonshot AI
Gemma 4 — Launch-Ankündigung (fünf Größen, 256K Kontext, 140+ Sprachen)
Mistral Small 4 — Model Card (119B/6,5B aktiv, 256K Kontext, Apache 2.0)
Hugging Face / Mistral AI
MiniMax-M3 — Model Card (~428B/~23B aktiv, MSA Sparse Attention, 1M Kontext)
Hugging Face / MiniMax AI
vLLM-Dokumentation — Serving, PagedAttention und Continuous Batching
vLLM
Self-Hosted LLM Leaderboard 2026 — Open-Weight-Modelle nach Qualität, Speed und Hardware
Onyx
Bereit für Ihr KI-Projekt?
Buchen Sie ein kostenloses 30-Minuten-Gespräch, um Ihre Anforderungen zu besprechen.
Beratung buchen