Entwicklungsansatz

MiMo V2.6 lokal vs. API (2026): Was der MoE-Stack kostet

MiMo V2.6 lokal vs. API (2026): 0,304 €/1M lokal gemessen, 0,54 $/1M API blended, FP4-Gewichte ab 600 GB — und die Entscheidungsregel für den MoE-Stack.

Geprüft von Michael Kerkhoff, Stand

Definition
Ein Modell, zwei Wege: Xiaomi stellt MiMo-V2.6 als Open Weights unter MIT-Lizenz bereit — Pro mit 1,02T Parametern und 42B aktiven als Mixture-of-Experts (MoE), dazu Flash (309B/15B) und ein 9B-Distill — und betreibt gleichzeitig eine API zum Spottpreis. Wir haben beide Seiten durchgerechnet: mit eigener Benchmark auf unserem vLLM-Cluster (30,8 tok/s, TTFT 0,295 s, 0,304 € pro 1M Output-Tokens, nur Strom) und mit den API-Listenpreisen (0,435 $/1M Input, 0,87 $/1M Output). Heraus kommt keine Rangliste, sondern eine Entscheidungsregel: wann Self-Hosting, wann API — und warum die FP4-Quantisierung daran nichts ändert.
Kategorie
Entwicklungsansatz
Optionen
MiMo V2.6 lokal (Self-Hosted, MXFP4)MiMo V2.6 API (Managed Endpoint)

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

MiMo V2.6 lokal (Self-Hosted, MXFP4) vs MiMo V2.6 API (Managed Endpoint)
FaktorMiMo V2.6 lokal (Self-Hosted, MXFP4)MiMo V2.6 API (Managed Endpoint)
Kosten pro 1M Tokens0,304 €/1M Output — nur Strom, gemessen auf unserer Referenz-Hardware (Flash-Klasse, 76,7 tok/s bei 8 Streams); ohne Abschreibung und Ops. Für Pro lokal käme die Abschreibung eines ~600-GB-Servers dazu.0,435 $/1M Input, 0,87 $/1M Output, 99 % Cache-Rabatt — blended rund 0,54 $ (≈ 0,50 €) pro 1M. Kein Fixkostenblock, kein Kapazitätsrisiko. Gewinner
Hardware-EinstiegshürdePro: ~500–600 GB für die FP4-Gewichte (1,02T Parameter) — Server-Klasse. Flash: ~160–190 GB. Auf 128-GB-Edge-Boxen läuft nur der 9B-Distill (~5 GB).Ein API-Key. Xiaomi serviert Pro inklusive UltraSpeed-Tier (FP4, rund 10× schneller) — die Hardware-Sorge bleibt bei Xiaomi. Gewinner
Durchsatz (Tokens per Second)30,8 tok/s im Einzelstrom, 76,7 tok/s bei 8 parallelen Streams (Median, 256 Token Output) — Referenz Flash-Klasse, skaliert nur mit weiterer Hardware.Rund 130 tok/s für Pro laut Artificial Analysis (Stand 23.09.2026), die UltraSpeed-Variante etwa 10× schneller. Gewinner
Latenz (Time-to-First-Token)0,295 s Median gemessen — kein Netz-Roundtrip, keine Warteschlange beim Anbieter, Anfragen bleiben im LAN. GewinnerArtificial Analysis misst 17,58 s Time-to-First-Answer im eigenen Benchmark — für einfache Prompts deutlich schneller, aber Netz und Queue liegen außerhalb Ihrer Kontrolle.
Datenhoheit & CompliancePrompts und Ausgaben verlassen das Haus nicht. MIT-Lizenz: Die Gewichte bleiben nutzbar, egal was Xiaomi dem API-Preis antut. Gewinner99 % Cache-Rabatt heißt: Prompts liegen gecacht beim Anbieter. Für interne Daten braucht es einen AVV — und die Akzeptanz des Anbieter-Caches.
BetriebsaufwandvLLM-Stack, Modell-Updates, Monitoring, Fallbacks. Unsere Flotte: 3835 Cron-Läufe in 30 Tagen, 78,8 % Erfolgsquote, 169 automatische Healer-Eingriffe. Machbar — aber Betrieb ist Arbeit.Null Ops: keine Versionen pinnen, keine GPUs kühlen, keine Kapazität planen. Preisänderungen sind das einzige Restrisiko. Gewinner
Gesamtpunktzahl · 0 unentschieden2 / 64 / 6

Wichtige Statistiken

Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.

Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Unsere Empfehlung

Regel 1 — Qualität aus der API: MiMo-V2.6-Pro führt den Open-Weights-Index mit 46 Punkten, kostet 0,435 $/1M Input und 0,87 $/1M Output bei 99 % Cache-Rabatt. Die FP4-Gewichte brauchen rund 500–600 GB Arbeitsspeicher — Server-Klasse, keine Edge-Box. Wer Pro lokal betreibt, finanziert Abschreibung und Ops gegen einen API-Preis, der fast schon Strompreis hat. Regel 2 — Volumen lokal, auf Pass-Größe: Unsere Messung (Referenz qwen3.8-flash-next-nvfp4, 8 Streams) liegt bei 76,7 Tokens per Second und 0,304 €/1M Output-Tokens, nur Strom. Seit die Flotte (3835 Cron-Läufe in 30 Tagen) lokal läuft, liegen die API-Kosten bei 0 $/Tag — vorher Ø 127,56 $/Tag; die Inferenzkosten des Tagegeschäfts stehen auf dem eigenen Dach. Regel 3 — MXFP4 ist fertig: Die Gewichte kommen vorkonstruiert in FP4, zweites Quantisieren spart nichts. Aus zwei unabhängigen Tests in unserem Betrieb: Flash schlägt Pro stellenweise. Der MoE-Stack lohnt trotzdem — bei konstantem Volumen, stehender Hardware und Datenhoheit als Pflicht.

Wählen Sie MiMo V2.6 lokal (Self-Hosted, MXFP4), wenn...
  • Ihre Daten das Haus nicht verlassen dürfen — Patient*innen-, Kund*innen- oder Mandatsdaten, für die ein AVV mit einem ausländischen Anbieter unangenehm wird.
  • Sie bereits GPU-Server betreiben und konstant hohes Volumen auf Flash-/Distill-Klasse fahren — unsere Referenz: 0,304 € pro 1M Output-Tokens, nur Strom.
  • Ihr Stack nachvollziehen bleiben muss — MIT-Lizenz, eigene Gewichte, keine Preisänderung zum Monatswechsel.
Wählen Sie MiMo V2.6 API (Managed Endpoint), wenn...
  • Sie die Index-Führung von Pro (46 Punkte) wollen, ohne ~600 GB FP4-Gewichte zu hosten — 0,435 $/1M Input, 0,87 $/1M Output, 99 % Cache-Rabatt.
  • Ihre Last burtig und unvorhersehbar ist — keine Kapazitätsplanung, rund 130 Tokens per Second ohne eigene Kühlung.
  • Ihr Team den Modellbetrieb (vLLM, Updates, Fallbacks) nicht zusätzlich stemmen will — die API ist null Ops.

Häufige Fragen zu diesem Vergleich beantwortet.

Häufig gestellte Fragen

(01)Lohnt sich MiMo V2.6 Pro lokal überhaupt?
Nur mit Server-Hardware ab grob 600 GB RAM für die FP4-Gewichte (1,02T Parameter, 42B aktive). Auf Edge-Boxen wie einem DGX Spark (128 GB) läuft höchstens der 9B-Distill. Unser Befund aus zwei unabhängigen Tests: Flash schlägt Pro stellenweise — die Pro-Qualität holt man sich günstiger aus der API (0,435 $/1M Input).
(02)Bringt es etwas, MXFP4 selbst nochmal zu quantisieren?
Nein. Die Gewichte kommen fertig in MXFP4 — eine zweite Kompressionsstufe spart nichts mehr, sie verschlechtert höchstens. Xiaomi serviert den UltraSpeed-Tier selbst in FP4. Eigenes Quantisieren lohnt nur bei Modellen, die nur in BF16/FP8 vorliegen.
(03)Was kostet 1M Tokens lokal wirklich?
Nur Strom: 0,304 € pro 1M Output-Tokens (gemessen: 76,7 tok/s bei 8 Streams, 240 W Nennleistung, 0,35 €/kWh). Ohne Hardware-Abschreibung, ohne Ops-Zeit. Mit beidem kippt die Rechnung — gegen 0,50 $ blended API ist ein Self-Hosted LLM erst bei vorhandenem Server und Dauerlast günstiger.
(04)Wann lohnt der MoE-Stack trotzdem?
Drei Bedingungen zusammen: konstantes Volumen (nicht Burst), bereits stehende Server-Hardware ab ~600 GB, und Datenhoheit als harte Anforderung. Fehlt einer davon: API für Pro, lokal Flash-/9B-Klasse fürs Tagegeschäft — genau so läuft unsere eigene Flotte seit August: 0 $/Tag API-Kosten bei 3835 Cron-Läufen in 30 Tagen.

Brauchen Sie Hilfe bei der Entscheidung?

Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

Kostenlose Beratung · Unverbindlich · Persönliche Antwort