---
type: "Comparison"
title: "MiMo V2.6 lokal vs. API (2026): Was der MoE-Stack kostet"
description: "MiMo V2.6 lokal vs. API (2026): 0,304 €/1M lokal gemessen, 0,54 $/1M API blended, FP4-Gewichte ab 600 GB — und die Entscheidungsregel für den MoE-Stack."
resource: "https://www.contextstudios.ai/de/vergleich/mimo-v2-6-lokal-vs-api"
language: "de"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-09T22:38:59.125Z"
status: "stable"
---

# MiMo V2.6 lokal vs. API (2026): Was der MoE-Stack kostet

Ein Modell, zwei Wege: Xiaomi stellt MiMo-V2.6 als Open Weights unter MIT-Lizenz bereit — Pro mit 1,02T Parametern und 42B aktiven als Mixture-of-Experts (MoE), dazu Flash (309B/15B) und ein 9B-Distill — und betreibt gleichzeitig eine API zum Spottpreis. Wir haben beide Seiten durchgerechnet: mit eigener Benchmark auf unserem vLLM-Cluster (30,8 tok/s, TTFT 0,295 s, 0,304 € pro 1M Output-Tokens, nur Strom) und mit den API-Listenpreisen (0,435 $/1M Input, 0,87 $/1M Output). Heraus kommt keine Rangliste, sondern eine Entscheidungsregel: wann Self-Hosting, wann API — und warum die FP4-Quantisierung daran nichts ändert.

## Detaillierter Vergleich

| Faktor | MiMo V2.6 lokal (Self-Hosted, MXFP4) | MiMo V2.6 API (Managed Endpoint) | Gewinner |
|--------|------|------|--------|
| Kosten pro 1M Tokens | 0,304 €/1M Output — nur Strom, gemessen auf unserer Referenz-Hardware (Flash-Klasse, 76,7 tok/s bei 8 Streams); ohne Abschreibung und Ops. Für Pro lokal käme die Abschreibung eines ~600-GB-Servers dazu. | 0,435 $/1M Input, 0,87 $/1M Output, 99 % Cache-Rabatt — blended rund 0,54 $ (≈ 0,50 €) pro 1M. Kein Fixkostenblock, kein Kapazitätsrisiko. | MiMo V2.6 API (Managed Endpoint) |
| Hardware-Einstiegshürde | Pro: ~500–600 GB für die FP4-Gewichte (1,02T Parameter) — Server-Klasse. Flash: ~160–190 GB. Auf 128-GB-Edge-Boxen läuft nur der 9B-Distill (~5 GB). | Ein API-Key. Xiaomi serviert Pro inklusive UltraSpeed-Tier (FP4, rund 10× schneller) — die Hardware-Sorge bleibt bei Xiaomi. | MiMo V2.6 API (Managed Endpoint) |
| Durchsatz (Tokens per Second) | 30,8 tok/s im Einzelstrom, 76,7 tok/s bei 8 parallelen Streams (Median, 256 Token Output) — Referenz Flash-Klasse, skaliert nur mit weiterer Hardware. | Rund 130 tok/s für Pro laut Artificial Analysis (Stand 23.09.2026), die UltraSpeed-Variante etwa 10× schneller. | MiMo V2.6 API (Managed Endpoint) |
| Latenz (Time-to-First-Token) | 0,295 s Median gemessen — kein Netz-Roundtrip, keine Warteschlange beim Anbieter, Anfragen bleiben im LAN. | Artificial Analysis misst 17,58 s Time-to-First-Answer im eigenen Benchmark — für einfache Prompts deutlich schneller, aber Netz und Queue liegen außerhalb Ihrer Kontrolle. | MiMo V2.6 lokal (Self-Hosted, MXFP4) |
| Datenhoheit & Compliance | Prompts und Ausgaben verlassen das Haus nicht. MIT-Lizenz: Die Gewichte bleiben nutzbar, egal was Xiaomi dem API-Preis antut. | 99 % Cache-Rabatt heißt: Prompts liegen gecacht beim Anbieter. Für interne Daten braucht es einen AVV — und die Akzeptanz des Anbieter-Caches. | MiMo V2.6 lokal (Self-Hosted, MXFP4) |
| Betriebsaufwand | vLLM-Stack, Modell-Updates, Monitoring, Fallbacks. Unsere Flotte: 3835 Cron-Läufe in 30 Tagen, 78,8 % Erfolgsquote, 169 automatische Healer-Eingriffe. Machbar — aber Betrieb ist Arbeit. | Null Ops: keine Versionen pinnen, keine GPUs kühlen, keine Kapazität planen. Preisänderungen sind das einzige Restrisiko. | MiMo V2.6 API (Managed Endpoint) |

## Wichtige Statistiken

- **API-Preis Pro: 0,435 $/1M Input, 0,87 $/1M Output (99 % Cache-Rabatt), blended ~0,54 $/1M; rund 130 tok/s; Open-Weights-Index 46** — [Artificial Analysis (Stand 23.09.2026)](https://artificialanalysis.ai) (2026)
- **Lokal gemessen: 0,304 €/1M Output-Tokens, nur Strom (76,7 tok/s @ 8 Streams, 30,8 tok/s Einzelstrom, TTFT 0,295 s; 240 W × 0,35 €/kWh, ohne Abschreibung)** — [Eigene Messung, DGX-Spark-vLLM-Cluster, Referenz qwen3.8-flash-next-nvfp4 (24.09.2026)](https://www.contextstudios.ai/de/vergleich/mimo-v2-6-lokal-vs-api) (2026)
- **Pro 1,02T/42B aktiv, Flash 309B/15B, 9B-Distill; MIT-Lizenz; 1M Kontext; RL-Posttraining 2,62 Mio. $ (Pro-Lauf), 3,47 Mio. $ beide Läufe** — [Xiaomi MiMo-V2.6 Release / Latent.Space AINews (22.09.2026)](https://www.latent.space/p/ainews-xiaomi-mimo-v26-pro-1t-a42b) (2026)
- **Eigene API-Ausgaben: Ø 127,56 $/Tag vor der Lokalisierung, seit 21.08.2026 0 $/Tag (Fleet läuft lokal), Spitze 268,59 $/Tag am 11.08.** — [cost-throttle-Monitor, eigener Betrieb (Stand 28.09.2026)](https://www.contextstudios.ai) (2026)

## Wählen Sie MiMo V2.6 lokal (Self-Hosted, MXFP4), wenn...

- Ihre Daten das Haus nicht verlassen dürfen — Patient*innen-, Kund*innen- oder Mandatsdaten, für die ein AVV mit einem ausländischen Anbieter unangenehm wird.
- Sie bereits GPU-Server betreiben und konstant hohes Volumen auf Flash-/Distill-Klasse fahren — unsere Referenz: 0,304 € pro 1M Output-Tokens, nur Strom.
- Ihr Stack nachvollziehen bleiben muss — MIT-Lizenz, eigene Gewichte, keine Preisänderung zum Monatswechsel.

## Wählen Sie MiMo V2.6 API (Managed Endpoint), wenn...

- Sie die Index-Führung von Pro (46 Punkte) wollen, ohne ~600 GB FP4-Gewichte zu hosten — 0,435 $/1M Input, 0,87 $/1M Output, 99 % Cache-Rabatt.
- Ihre Last burtig und unvorhersehbar ist — keine Kapazitätsplanung, rund 130 Tokens per Second ohne eigene Kühlung.
- Ihr Team den Modellbetrieb (vLLM, Updates, Fallbacks) nicht zusätzlich stemmen will — die API ist null Ops.

## Unsere Empfehlung

Regel 1 — Qualität aus der API: MiMo-V2.6-Pro führt den Open-Weights-Index mit 46 Punkten, kostet 0,435 $/1M Input und 0,87 $/1M Output bei 99 % Cache-Rabatt. Die FP4-Gewichte brauchen rund 500–600 GB Arbeitsspeicher — Server-Klasse, keine Edge-Box. Wer Pro lokal betreibt, finanziert Abschreibung und Ops gegen einen API-Preis, der fast schon Strompreis hat. Regel 2 — Volumen lokal, auf Pass-Größe: Unsere Messung (Referenz qwen3.8-flash-next-nvfp4, 8 Streams) liegt bei 76,7 Tokens per Second und 0,304 €/1M Output-Tokens, nur Strom. Seit die Flotte (3835 Cron-Läufe in 30 Tagen) lokal läuft, liegen die API-Kosten bei 0 $/Tag — vorher Ø 127,56 $/Tag; die Inferenzkosten des Tagegeschäfts stehen auf dem eigenen Dach. Regel 3 — MXFP4 ist fertig: Die Gewichte kommen vorkonstruiert in FP4, zweites Quantisieren spart nichts. Aus zwei unabhängigen Tests in unserem Betrieb: Flash schlägt Pro stellenweise. Der MoE-Stack lohnt trotzdem — bei konstantem Volumen, stehender Hardware und Datenhoheit als Pflicht.

## Häufig gestellte Fragen

**Q: Lohnt sich MiMo V2.6 Pro lokal überhaupt?**
A: Nur mit Server-Hardware ab grob 600 GB RAM für die FP4-Gewichte (1,02T Parameter, 42B aktive). Auf Edge-Boxen wie einem DGX Spark (128 GB) läuft höchstens der 9B-Distill. Unser Befund aus zwei unabhängigen Tests: Flash schlägt Pro stellenweise — die Pro-Qualität holt man sich günstiger aus der API (0,435 $/1M Input).

**Q: Bringt es etwas, MXFP4 selbst nochmal zu quantisieren?**
A: Nein. Die Gewichte kommen fertig in MXFP4 — eine zweite Kompressionsstufe spart nichts mehr, sie verschlechtert höchstens. Xiaomi serviert den UltraSpeed-Tier selbst in FP4. Eigenes Quantisieren lohnt nur bei Modellen, die nur in BF16/FP8 vorliegen.

**Q: Was kostet 1M Tokens lokal wirklich?**
A: Nur Strom: 0,304 € pro 1M Output-Tokens (gemessen: 76,7 tok/s bei 8 Streams, 240 W Nennleistung, 0,35 €/kWh). Ohne Hardware-Abschreibung, ohne Ops-Zeit. Mit beidem kippt die Rechnung — gegen 0,50 $ blended API ist ein Self-Hosted LLM erst bei vorhandenem Server und Dauerlast günstiger.

**Q: Wann lohnt der MoE-Stack trotzdem?**
A: Drei Bedingungen zusammen: konstantes Volumen (nicht Burst), bereits stehende Server-Hardware ab ~600 GB, und Datenhoheit als harte Anforderung. Fehlt einer davon: API für Pro, lokal Flash-/9B-Klasse fürs Tagegeschäft — genau so läuft unsere eigene Flotte seit August: 0 $/Tag API-Kosten bei 3835 Cron-Läufen in 30 Tagen.

