Lokale KI · Rezept · 1× DGX Spark

Ornith-1.5 35B FP8 mit vLLM auf 1× DGX Spark

von sfxnz

Für dieses Rezept ist kein Tempowert belegt. Die Seite ist deshalb nicht indexiert.

Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
ModelOpt W4A16_NVFP4-Experten + FP8-Attention, FP8-KV, Marlin MoE, FlashInfer, MTP-3 (triton)
Modellfamilie
Ornith-1.5
Kontext
262.144
Parameter
35B-A3B (Repo-Titel); HF-API safetensors total 19,528,501,104
Kreator
sfxnz
GitHub-Sterne
1
Repo-Stand
4. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Zeit bis zum ersten Token

Kürzer ist besser.

  • Prompt nicht angegeben121 msKontext 256 in / 128 out (random) · Mean TTFT der completions-256/128 max-concurrency-1-Tabelle Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.