Lokale KI · Rezept · 1× DGX Spark

Laguna-S-2.1 118B NVFP4 mit vLLM auf 1× DGX Spark (128k Kontext)

Laguna-S-2.1 118B NVFP4 mit vLLM auf 1× DGX Spark (128k Kontext): 19,3 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

19,3tok/sAlltag

1 Anfrage, Prosa-Prompt, Kontext 1k, ohne Spekulation

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
NVFP4 (Blackwell-native, auto-detected aus quantization_config)
Modellfamilie
Laguna-S-2.1
Kontext
131.072
Parameter
118B total / 8B aktiv MoE (README)
Kreator
Weschera
GitHub-Sterne
3
Repo-Stand
21. Juli 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)19,3 tok/sKontext 1K · Kein Spec-Decoding im Baseline-Profil; 19.0 @8K, 18.2 @31K — barely degrades Quelle 
  • Spitze (Decode)53 tok/sDFlash k=15, pure code generation (600-tok class impl), 2.8×; prose ~19 (kein Gain); mean acceptance ~2.3 auf Code Quelle 

Prefill je Kontext

  • 31K3.703 tok/s2170 @1K, 3451 @8K, 3703 @31K Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
131.072 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.