Local AI

Dein erstes lokales LLM-Setup an einem Wochenende

Dein erstes lokales LLM-Setup an einem Wochenende

Du willst ein LLM lokal laufen lassen — ohne Cloud, ohne Abo, ohne Datenabfluss. Der Weg dorthin ist 2026 einfacher als je, aber die Zahl der Entscheidungen (Hardware, Modell, Quantisierung, Engine) ist verwirrend. Dieser Artikel führt dich in einem Wochenende von „ich habe einen Rechner" zu „mein eigener LLM-Endpoint läuft" — mit konkreten Rezepten aus unserer Datenbank für jede Hardware-Stufe.

Schritt 1 (Samstag vormittag): Hardware ehrlich einordnen

Du brauchst keine neue Hardware, um anzufangen — du brauchst die richtige Erwartung an deine vorhandene:

  • 16 GB RAM (Laptop): Qwen3.8-27B als 4-Bit-Quant (~19 GB ist zu viel, nimm den Q3-Quant oder einen 8B–14B). Chat-Qualität auf Desktop-Niveau, keine Wunder.
  • 24 GB VRAM (RTX 3090/4090): Die Sweet-Spot-Klasse. Qwen3.6 35B-A3B passt als INT4 rein und ist schnell.
  • 32 GB (RTX 5090): Qwen3.6 35B-A3B NVFP4 mit ~250 tok/s — das schnellste Single-GPU-Erlebnis unter 5.000 €.
  • 64–128 GB (Mac / DGX Spark): Hier beginnen die „richtigen" Modelle: Qwen3.8-Flash-Next (4-Bit MLX: 112 GB) oder GLM-5.3-Flash als 3-Bit-Quant.

Faustregel: Modellgewichte + 20 % Overhead für Kontext müssen in den Speicher passen. Alles darüber heißt Quantisierung schärfer oder Modell kleiner.

Schritt 2 (Samstag Nachmittag): Software-Stack wählen

Der einfachste Stack für den Einstieg:

  1. Ollama oder LM Studio installieren — beide laufen auf Mac und Linux/Windows, beide reden OpenAI-Format.
  2. Ein Modell ziehen: ollama pull qwen3.8:27b (Größe prüfen!) — oder in LM Studio aus der Suche.
  3. Testen: Chat-Fenster öffnen, denselben Prompt dreimal stellen. Fühlt sich die Antwortgeschwindigkeit flüssig an? Gut. Stockt sie? Quantisierung eine Stufe kleiner.

Für alles darüber hinaus (Tool-Calling, Agent-Betrieb, eigene Endpoints) brauchst du später vLLM oder llama.cpp — aber nicht am ersten Tag.

Schritt 3 (Sonntag vormittag): Einen echten Use Case wiren

Ein lokales Modell ohne Anschluss bleibt ein Spielzeug. Der einfachste sinnvolle Anschluss:

  • Coding-Assistent: Continue oder ein OpenAI-kompatibler Endpoint in deinem Editor auf http://localhost:11434 zeigen lassen.
  • Dokumenten-Zusammenfassungen: Open WebUI davor setzen, PDFs hochladen, lokal zusammenfassen lassen.
  • Agenten: Jedes Agent-Framework, das OpenAI-Format spricht, kann deinen lokalen Endpoint nutzen — Base-URL austauschen, fertig.

Unser eigener Produktionsstack (Blog-Pipeline, Analysen) läuft ebenfalls teils über lokale Endpoints — der Weg von „lokal testen" zu „lokal produzieren" ist kürzer als man denkt.

Schritt 4 (Sonntag Nachmittag): Die Messung, die dir gehört

Bevor du irgendeinem Benchmark im Netz glaubst, miss selbst:

code
prompt = dein typischer realer Arbeitsprompt (nicht "count to 300")
3 Durchläufe, Median nehmen
decode tok/s UND Zeit bis zum ersten Token notieren

Genau diese zwei Zahlen — Decode und TTFT — entscheiden, ob sich deine Nutzung flüssig anfühlt. Alles andere ist Wenn-dann-Aber. Und wenn deine Zahl deutlich unter dem Recipe-Wert aus der Datenbank liegt: Power-Limit der GPU prüfen (Laptops drosseln!), Engine-Version vergleichen, KV-Cache-Einstellungen anschauen.

Die häufigsten Anfängerfehler

  1. Das größte Modell wählen, das „so gerade passt" — mit 2 % Puffer tauscht jedes lange Gespräch Kontext gegen Qualität. Lieber eine Stufe kleiner und 30 % Luft.
  2. Benchmark-Zahlen anderer Rigs auf die eigenen projizieren — dein thermisches Limit, dein Strom-Limit, deine Engine-Version.
  3. Tool-Calling ohne Engine-Support erwarten — nicht jede Engine parst Tool-Aufrufe; das steht in den Recipe-Notizen.
  4. Ohne Messung tunen — erst messen, dann schrauben. Ansonsten optimierst du das Gefühl, nicht das System.

Von hier aus

Wenn dein Endpoint läuft, ist die natürliche nächste Stufe: ein Rezept aus unserer Local-AI-Datenbank für deine Hardware-Stufe übernehmen — dort sind Rezepte von 1× RTX 3090 bis 4× DGX Spark mit Messwerten, Quantisierungsangaben und Original-Repositories verlinkt. Kopiere die Serve-Flags, vergleiche mit deiner Messung, und du betreibst dasselbe Setup wie die Community-Autoren.

Häufige Fragen

Brauche ich zwingend eine GPU? Nein — ein Mac mit genug Unified Memory oder sogar ein starker Laptop reichen für den Einstieg (Qwen3.8-27B Q3, 8B–14B-Modelle). GPU wird wichtig, wenn Geschwindigkeit oder Agent-Betrieb mit Tool-Calls dazukommen.

Ollama oder LM Studio? Für den ersten Tag egal — beide funktionieren. LM Studio hat die bessere GUI, Ollama das schlankere CLI und bessere Skriptbarkeit. Wer später mit vLLM/llama.cpp produktiv gehen will, wird ohnehin umsteigen; der Wechsel kostet einen Nachmittag.

Welches Modell ist der beste Einstieg? Qwen3.8-27B (Apache 2.0, multimodal, 4-Bit ~19 GB) ist 2026 der Standard-Einstieg — führend in seiner Klasse, überall unterstützt. Für 24-GB-GPUs: Qwen3.6 35B-A3B. Für die erste Berührung überhaupt: ein 8B-Modell, nur um den Loop zu sehen.

Wie viel Festplatte brauche ich? Rechne pro Modell 1,5–2× die Download-Größe (Download-Cache + entpackte Gewichte). Ein 27B-4-bit-Modell: ~19 GB Gewicht, planst du 50 GB Platz ein. Für Experimente mit mehreren Modellen: 1 TB NVMe ist die bequeme Größenordnung.

Kann ich später auf größere Hardware umziehen? Ja, das ist der Punkt bei Open Weights: dasselbe Modell, dieselben Quants laufen auf der nächsten Stufe erneut — nur schneller. Deine Prompts, dein Setup und deine Messmethodik wandern mit. Deshalb lohnt es sich, von Anfang an sauber zu messen.

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h