Lokale KI · Rezept · 1× DGX Spark

Nemotron-3.5 30B NVFP4 mit vLLM auf 1× DGX Spark

Nemotron-3.5 30B NVFP4 mit vLLM auf 1× DGX Spark: 93 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von sfxnz

93tok/sSpitze

1 Anfrage, Bestwert der Quelle

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis13mit Denken

Engine

Engine
vLLM
Quantisierung
NVFP4 (modelopt_mixed), FP8-KV, Marlin MoE, DSpark-3
Modellfamilie
Nemotron-3.5
Kontext
262.144
Parameter
30B total / ~3B active (README); HF-API safetensors total 17,820,210,764
Kreator
sfxnz
GitHub-Sterne
1
Repo-Stand
4. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)93 tok/sL.A.I.L-Lab-Bench, Run id 20260812T131332Z_d0f7ae; Quelle '~93 tok/s' → approx; Messmethodik/Prompt im Repo nicht dokumentiert Quelle 

Prefill je Kontext

  • Prompt nicht angegeben678 tok/sQuelle '~678 tok/s' → approx; L.A.I.L-Lab-Bench Quelle 

Zeit bis zum ersten Token

Kürzer ist besser.

  • Prompt nicht angegeben246 msQuelle '~246 ms' (TTFT p50) → approx Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.