Fine-Tuning für Sprachmodelle

LLM Fine-Tuning

LLM Fine-Tuning trainiert ein vortrainiertes Sprachmodell mit Ihren Beispielen weiter, damit es Fachsprache, Tonalität und Ausgabeformate zuverlässig trifft – dort, wo Prompts und RAG allein nicht reichen. Context Studios, ein KI-natives Entwicklungsstudio aus Berlin, übernimmt Datenaufbereitung, Training, Evaluation und Betrieb, auf Wunsch vollständig auf eigener Infrastruktur.

Sternwarte mit patinierter Kupferkuppel unter bedecktem Himmel, von unten fotografiertKI-generiertes Bild
Domänenspezifische AnpassungOpen-Source- und kommerzielle ModelleMessbare Qualität per EvaluationDSGVO-konformes Training
  1. Workshop
  2. Setup
  3. Sprint
  4. Build & Begleitung

Festpreis nach Scoping · Angebot in 48 h

Stand:

(01)

Was ist LLM Fine-Tuning?

KI-Technologie

LLM Fine-Tuning ist das Weitertrainieren eines vortrainierten Sprachmodells mit domänenspezifischen Beispielen, um es auf bestimmte Aufgaben, Fachsprachen oder Ausgabeformate zu spezialisieren. Während RAG Wissen zur Laufzeit ergänzt, verändert Fine-Tuning das Verhalten des Modells selbst – etwa Stil, Terminologie und Struktur der Antworten.

Spezialisierung
LoRA, QLoRA, vollständiges Fine-Tuning, DPO
Technologien
Hugging Face Transformers, Axolotl, Unsloth, vLLM
Zielgruppe
Unternehmen mit spezifischer Fachsprache, festen Ausgabeformaten oder Datenschutzanforderungen
Projektdauer
Typischerweise 4–12 Wochen inklusive Datenaufbereitung
Compliance
DSGVO, Datensouveränität, Training On-Premise möglich

LLM-EntwicklungRAG-EntwicklungMachine-Learning-EntwicklungGenerative KI-Entwicklung

(02)

Welche Fine-Tuning-Leistungen bieten wir?

Von der Trainingsdaten-Kuratierung bis zum optimierten Produktionsmodell

(01)

Trainingsdaten-Aufbereitung

Wir kuratieren, bereinigen und strukturieren Ihre Beispiele, entfernen personenbezogene Daten und ergänzen fehlende Fälle – die Datenqualität entscheidet über das Ergebnis.

(02)

LoRA- und QLoRA-Fine-Tuning

Parametereffiziente Verfahren passen nur einen kleinen Teil der Modellgewichte an. Das macht Training und Betrieb deutlich günstiger und erlaubt mehrere spezialisierte Varianten eines Basismodells.

(03)

Domänen-Spezialisierung

Das Modell lernt Ihre Fachbegriffe, Ihren Stil und Ihre Antwortstrukturen – etwa für Gutachten, Produkttexte, Klassifikationen oder strukturierte Extraktion.

(04)

Evaluation & Benchmarking

Automatische Testsets, menschliche Bewertung und A/B-Tests messen, ob das angepasste Modell besser ist als Basismodell und Prompting – objektiv und reproduzierbar.

(05)

Präferenz-Training & Optimierung

Mit DPO oder vergleichbaren Verfahren richten wir Antworten an Ihren Präferenzen aus; Quantisierung reduziert anschließend Speicherbedarf und Latenz.

(06)

Self-Hosted Deployment

Vom Training bis zum produktiven Einsatz mit vLLM auf eigener oder europäischer Infrastruktur – mit Pipelines für regelmäßiges Nachtraining.

(03)

Wie läuft ein Fine-Tuning-Projekt ab?

  1. (01)

    Erstgespräch

    Kostenloses 30-Minuten-Gespräch per Video-Call mit Michael Kerkhoff. Wir verstehen Ihr Vorhaben, prüfen die KI-Potenziale und geben eine erste Einschätzung zu Machbarkeit, Aufwand und Zeitrahmen.

    Schritt 1
  2. (02)

    Angebot & Planung

    Detaillierte Aufschlüsselung der Funktionen, technischer Architekturplan und ein schriftliches Angebot mit Umfang, Zeitplan und Festpreis.

    Schritt 2
  3. (03)

    KI-beschleunigte Entwicklung

    Agile Entwicklung mit wöchentlichen Demos und produktionsreifem Code mit automatisierten Tests. Ziel: ein funktionsfähiges MVP in ca. 4 Wochen.

    Schritt 3
  4. (04)

    Launch & Betrieb

    Produktions-Deployment mit vollständiger Dokumentation und Übergabe. 30 Tage kostenlose Fehlerbehebung ab der finalen Lieferung; Wartung und Weiterentwicklung nach Vereinbarung.

    Schritt 4

Häufige Fragen zum Fine-Tuning von Sprachmodellen

(01)Wann ist Fine-Tuning besser als RAG?
Fine-Tuning lohnt sich, wenn ein Modell einen bestimmten Stil, eine Fachsprache oder ein festes Ausgabeformat zuverlässig treffen soll oder wenn ein kleineres Modell eine Aufgabe günstiger erledigen soll. RAG ist besser, wenn es um aktuelles, sich änderndes Wissen mit Quellenangabe geht. Häufig ist die Kombination beider Ansätze die beste Lösung.
(02)Wie viele Trainingsdaten benötigen wir?
Typischerweise einige hundert bis mehrere tausend hochwertige Beispiele, je nach Aufgabe und Methode; Qualität und Vielfalt sind wichtiger als die reine Menge. Wir helfen bei der Kuratierung, erzeugen bei Bedarf ergänzende Beispiele und prüfen vorab mit einem kleinen Experiment, ob sich der Aufwand lohnt.
(03)Was kostet LLM Fine-Tuning?
Die Kosten hängen von Methode, Datenmenge, Modellgröße und Evaluierungsaufwand ab; ein LoRA-Training auf einem Open-Source-Modell mit vorhandenen Daten ist deutlich kleiner als ein Projekt mit neu erstelltem Datensatz. Festpreis nach Scoping, Angebot in 48 Stunden. Dazu kommen Rechenkosten für Training und Betrieb.
(04)Welche Modelle eignen sich am besten für Fine-Tuning?
Open-Source-Modelle wie Llama, Mistral, Qwen oder DeepSeek bieten volle Kontrolle und lassen sich selbst hosten. Kommerzielle Anbieter bieten Fine-Tuning für ausgewählte Modelle über ihre APIs an, etwa für GPT. In der Analyse empfehlen wir das passende Basismodell nach Qualität, Kosten, Lizenz und Datenschutz.
(05)Behalten wir die Rechte am fine-getunten Modell?
Für die im Projekt entstehenden Ergebnisse erhalten Sie die ausschließlichen Nutzungsrechte nach AGB Ziffer 5. Bei Open-Source-Modellen gelten zusätzlich deren Lizenzbedingungen, bei kommerziellen APIs die Bedingungen des Anbieters. Die Rechte an Trainingsdaten und Modellgewichten halten wir vor Projektstart schriftlich fest.
(06)Wie lange dauert ein Fine-Tuning-Projekt?
Ein Projekt dauert typischerweise 2–6 Wochen inklusive Datenvorbereitung, Training und Evaluation. Komplexere Vorhaben mit mehreren Iterationen, eigenem Datensatz oder Präferenz-Training benötigen in der Regel 6–12 Wochen. Das eigentliche Training ist dabei meist der kürzeste Teil; die meiste Zeit fließt in Daten und Tests.
(07)Kann ein fine-getuntes Modell auch RAG nutzen?
Ja, und das ist oft die stärkste Kombination: Das Modell lernt durch Fine-Tuning Fachsprache, Ton und Ausgabeformate, während RAG zur Laufzeit aktuelles Wissen mit Quellenangabe liefert. So bleiben die Antworten stilistisch konsistent und inhaltlich aktuell, ohne das Modell bei jeder Wissensänderung neu trainieren zu müssen.
(08)Was passiert, wenn sich unsere Daten ändern?
Das Training kann mit neuen Beispielen fortgesetzt werden. Wir richten Pipelines ein, die neue Daten sammeln, prüfen und in regelmäßigen Abständen ein Nachtraining starten; jede neue Modellversion durchläuft dieselben Tests, bevor sie live geht. Schnell veränderliches Wissen gehört dagegen besser in ein RAG-System.
(09)Können wir das Modell auf eigener Hardware betreiben?
Bei Open-Source-Modellen ja: Wir betreiben das Modell auf Ihrer Infrastruktur oder bei einem europäischen Anbieter, optimiert mit vLLM und Quantisierung. Das gibt Ihnen volle Datenhoheit und planbare Kosten. Welche Hardware nötig ist, hängt von Modellgröße, Last und Antwortzeiten ab; das klären wir vorab.
(10)Wie messen wir, ob Fine-Tuning erfolgreich war?
Mit einem Testset aus echten Aufgaben, das vor dem Training festgelegt wird. Wir vergleichen das angepasste Modell mit dem Basismodell und mit gutem Prompting – automatisch und durch menschliche Bewertung, etwa bei Korrektheit, Konsistenz, Fachsprache und Tonalität. Nur wenn der Gewinn deutlich ist, empfehlen wir den Einsatz.
(04)

Technologie-Stack für Fine-Tuning

(01)

AI & ML

Open-Source-LLMs (Llama, Mistral, Qwen, DeepSeek)Fine-Tuning-APIs kommerzieller Anbieter (z. B. OpenAI GPT)Hugging Face Transformers & PEFTLoRA, QLoRA, DPOAxolotl & Unsloth (Training)vLLM (Inferenz)Evaluation mit eigenen Testsets
(02)

Web & Mobile

Next.js & ReactTypeScriptReact Native & ExpoTailwind CSSshadcn/uiVercel Edge Runtime
(03)

Backend & Data

Node.js & HonoPythonPostgreSQL & SupabaseConvex (Real-Time DB)RedistRPC & GraphQLOpenAPI
(04)

DevOps & Infrastructure

Vercel & AWSDocker & KubernetesCI/CD (GitHub Actions)OpenTelemetry & GrafanaLangfuse (LLM Monitoring)
(05)

Fine-Tuning nach Branche

Rechtsbranche

Modelle, die juristische Terminologie und Zitierweisen sicher beherrschen – für Vertragsanalyse, Recherche-Zusammenfassungen und Schriftsatzentwürfe.

Medizin & Pharma

Sprachmodelle für medizinische Dokumentation und Fachkommunikation, präzise in der Fachsprache und immer mit fachlicher Prüfung.

Finanzwesen

Modelle für Risikoberichte, Compliance-Texte und strukturierte Extraktion aus Finanzdokumenten mit festen Formaten.

Technische Dokumentation

Konsistente Anleitungen, Datenblätter und Übersetzungen, die Ihre Terminologie und Styleguides einhalten.

Kundenservice

Antworten im Ton Ihrer Marke, mit festen Strukturen und korrekter Klassifikation von Anliegen.

Versicherungen

Schadensbeschreibungen, Klassifikation und Zusammenfassungen, die den internen Vorgaben und Fachbegriffen entsprechen.

(06)

Fine-Tuning: Projektbeispiele

Beispiele, die wir umsetzen können

Kundenservice

Klassifikation von Serviceanfragen

Ein kleines Open-Source-Modell wird darauf trainiert, eingehende Anfragen den richtigen Kategorien zuzuordnen und strukturierte Felder zu extrahieren – günstiger als ein großes Modell.

Eigenes Testset · Self-Hosting · Ziel: geringere Kosten pro Anfrage
Beratung

Berichtsentwürfe im Hausstil

Ein Modell lernt Aufbau, Terminologie und Tonalität interner Berichte und erstellt Entwürfe, die Fachleute nur noch prüfen und ergänzen.

LoRA-Adapter · Menschliche Freigabe · Konsistenter Stil
Industrie

Fachsprachliche Extraktion

Ein angepasstes Modell liest technische Dokumente und extrahiert Kennwerte in ein festes Schema, kombiniert mit RAG für aktuelle Produktdaten.

Festes Ausgabeformat · Kombination mit RAG · Regelmäßiges Nachtraining
(07)

Fine-Tuning – Beratung in Berlin

Gründer KI-nativ seit
2024
E-Mail
info [at] contextstudios [punkt] ai

Sprachmodelle für Ihr Unternehmen anpassen

Sprechen Sie 30 Minuten mit uns über Ihre Daten und Ziele – wir sagen Ihnen ehrlich, ob Fine-Tuning, RAG oder beides passt.