KI-Agenten einsetzen

Lokale KI-Agenten auf eigener Hardware. Ihre KI arbeitet im eigenen Haus – Ihre Daten verlassen es nicht.

Aufbau lokaler KI-Hardware mit offenen Sprachmodellen und KI-Agenten im eigenen Haus

  1. Workshop
  2. Setup
  3. Sprint
  4. Build & Begleitung

Festpreis nach Scoping · Angebot in 48 h

Stand: September 2026

Lokale KI-Agenten auf eigener Hardware
Lokale KI-Agenten auf eigener Hardware
Lokale KI-Agenten auf eigener Hardware

Lokale KI-Agenten sind KI-Assistenten, deren Sprachmodell und Agenten-Software auf Hardware im eigenen Unternehmen laufen statt bei einem Cloud-Anbieter.

Wir bauen KI-Infrastruktur direkt bei Ihnen auf: einen Mac Studio, eine NVIDIA DGX Spark oder einen Rechner mit AMD Ryzen AI Max – je nachdem, welche Modelle und wie viele Nutzer Sie brauchen. Darauf laufen offene Sprachmodelle wie Qwen, DeepSeek, GLM oder gpt-oss über eine lokale Laufzeitumgebung wie llama.cpp, Ollama, MLX oder vLLM. Für die Agenten setzen wir auf Hermes Agent, ein quelloffenes Agenten-Framework von Nous Research: mit Gedächtnis, wiederverwendbaren Skills, Zeitplaner und Anbindung an Slack, Telegram oder E-Mail. Über MCP greifen die Agenten auf Ihre Systeme zu – mit Freigaben, die Sie festlegen. Anfragen und Dokumente werden auf Ihrer Hardware verarbeitet, kein Cloud-Anbieter sieht sie.

Für wen

Ideal für Unternehmen, die KI mit vertraulichen Daten nutzen wollen – Kundendaten, Verträge, Konstruktionspläne, Personalakten – und diese Daten nicht an einen Cloud-Anbieter geben dürfen oder wollen. Besonders passend für Kanzleien, Praxen, Industrie und Mittelstand mit hohen Anforderungen an Datenschutz und Geschäftsgeheimnisse.

Hauptmerkmale

  • Vor Ort betrieben
  • Datensouverän
  • Sicher
  • Mit Guardrails geschützt
  • Least-Privilege-Prinzip
  • Dokumentiert
  • Hermes Agent
  • llama.cpp
  • Ollama
  • MLX
  • vLLM
  • Qwen
  • DeepSeek
  • GLM
  • gpt-oss
  • MCP
  • Docker

Wir wählen die besten Tools für Ihre spezifischen Anforderungen

(01)

Hardware

Die Maschine bei Ihnen vor Ort. Entscheidend ist der Speicher: Er bestimmt, wie große Modelle laufen.

KlasseGeräteSpeicherWas realistisch läuft
KompaktEinzelne TeamsNVIDIA DGX Spark · Rechner mit AMD Ryzen AI Max+128 GBModelle bis rund 120 Mrd. Parameter, etwa gpt-oss-120b
WorkstationFachabteilungenApple Mac Studio mit M5 Ultrabis 512 GBGroße Mixture-of-Experts-Modelle mit mehreren hundert Mrd. Parametern
ClusterMehrere Abteilungen2–4 vernetzte Mac Studios oder DGX Sparks256 GB und mehr, verteiltSehr große Modelle, verteilt auf mehrere Geräte
EnterpriseUnternehmensweitNVIDIA DGX Station · Workstations mit RTX PRO 600096 GB bis rund 780 GBViele gleichzeitige Nutzer im Produktivbetrieb

Faustregel: Ein Modell braucht in 4-Bit-Quantisierung rund 0,6 GB Speicher pro Milliarde Parameter, dazu Platz für den Kontext. Die konkrete Auswahl treffen wir im Workshop anhand Ihrer Aufgaben.

(02)

Laufzeit

Die Software, die das Modell ausführt und eine OpenAI-kompatible Schnittstelle bereitstellt.

  • llama.cpp
  • Ollama
  • LM Studio
  • MLX
  • vLLM
  • SGLang

MLX auf dem Mac, vLLM oder SGLang auf NVIDIA, llama.cpp auf AMD – jeweils das, was auf Ihrer Hardware am schnellsten läuft.

(03)

Modelle

Offene Modelle, deren Gewichte auf Ihrer Hardware liegen. Wir wählen nach Aufgabe, Sprache und Lizenz.

FamilieStärkeLizenz
Qwen (Alibaba)Vielseitig, stark im Programmieren und mit WerkzeugenApache 2.0 bei kleinen und mittleren Varianten
DeepSeekLogisches Denken, sehr große VariantenMIT
GLM (Zhipu)Agentische Aufgaben und ProgrammierenMIT oder eigene Lizenz, je Variante
gpt-oss (OpenAI)Kompakt, mit WerkzeugaufrufenApache 2.0
MistralEuropäischer Anbieter, mehrsprachigApache 2.0
Gemma (Google)Kleine bis mittlere Modelle, auch für BilderApache 2.0

Neue Versionen erscheinen im Monatstakt. Wir testen vor dem Einsatz mit Ihren eigenen Daten und prüfen die Lizenz je Modell.

(04)

Agenten

Hermes Agent plant Aufgaben, nutzt Werkzeuge und erinnert sich an frühere Gespräche.

  • Gedächtnis über Gespräche hinweg
  • Skills, die der Agent aus erledigten Aufgaben ableitet
  • Zeitplaner für wiederkehrende Aufgaben
  • Erreichbar über Slack, Telegram, Discord oder E-Mail
  • Zugriff auf Ihre Systeme über MCP
  • Sub-Agenten für parallele Arbeit

Hermes Agent ist quelloffen (MIT-Lizenz) und stammt von Nous Research.

Sicherheit und Betrieb

Lokal heißt nicht automatisch sicher. Darum gehört das zum Aufbau:

  • Agenten laufen in Containern, nicht direkt auf dem Rechner
  • Heikle Aktionen brauchen Ihre Freigabe
  • Skills werden vor der Installation geprüft
  • Leitplanken für das Modellverhalten, besonders bei Kundenkontakt
  • Geregelter Update-Prozess für Modelle, Laufzeit und Agenten
  • Auf Wunsch abgeschotteter Betrieb ohne Internetverbindung

So arbeiten wir daran

  1. Workshop
  2. Setup
  3. Sprint
  4. Build & Begleitung
(01)

Workshop

Ein moderierter Termin, an dessen Ende eine bewertete Liste Ihrer Vorhaben steht.

½–2 Tage · drei Festpreise
(02)

Setup

Wir richten ein abgegrenztes System ein und übergeben es einsatzbereit.

1–2 Wochen · Festpreis nach Scoping
(03)

Build & Begleitung

Wir bauen das Vorhaben aus und bleiben danach im Betrieb an Ihrer Seite.

nach Scoping, laufend · Festpreis nach Scoping; Begleitung monatlich

Enthalten

(01)

Workshop zu Aufgaben, Nutzerzahl und Datenlage als Grundlage für die Hardware-Auswahl

(02)

Empfehlung und Einrichtung der Hardware: Mac Studio, NVIDIA DGX Spark oder Rechner mit AMD Ryzen AI Max

(03)

Lokale Laufzeitumgebung (z. B. llama.cpp, Ollama, MLX oder vLLM) mit OpenAI-kompatibler Schnittstelle

(04)

Auswahl offener Modelle nach Aufgabe, Sprache und Lizenz, etwa Qwen, DeepSeek, GLM oder gpt-oss

(05)

Agenten mit Hermes Agent: Gedächtnis, wiederverwendbare Skills und Zeitplaner

(06)

Zugriffsrechte, Protokollierung und Einweisung Ihres Teams

(07)

30 Tage kostenlose Fehlerbehebung ab der finalen Lieferung

Nicht enthalten

(01)

Anschaffungskosten der Hardware

(02)

Anbindung weiterer Systeme über den vereinbarten Umfang hinaus (separat nach Scoping)

(03)

Rechtsberatung zur EU-KI-Verordnung oder DSGVO

(04)

Laufende Betreuung nach den 30 Tagen Fehlerbehebung – buchbar als Build & Begleitung

Ablauf

(01)

Workshop

In einem Workshop (½–2 Tage) klären wir Aufgaben, Nutzerzahl und Daten und legen Hardware, Modelle und Lizenzen fest.

T1
(02)

Hardware & Laufzeit

Einrichtung der Maschine bei Ihnen vor Ort, Laufzeitumgebung und die ausgewählten offenen Modelle.

W1
(03)

Agenten & Übergabe

Hermes Agent mit Skills und Anbindung an Ihre Systeme, Zugriffsrechte, Einweisung und Dokumentation.

W2
(04)

Ausbau

Optional: weitere Agenten, Anbindungen und Nutzergruppen schrittweise, Umfang nach Scoping.

Build
(01)Welche Hardware brauchen wir?
Das hängt von der Modellgröße und der Zahl der Nutzer ab. Für Modelle bis rund 120 Milliarden Parameter in 4-Bit-Quantisierung reichen Geräte mit 128 GB gemeinsamem Speicher, etwa eine NVIDIA DGX Spark oder ein Rechner mit AMD Ryzen AI Max+ 395. Größere Modelle brauchen einen Mac Studio mit M5 Ultra (bis zu 512 GB, Auslieferung dieser Konfigurationen ab Ende Oktober 2026) oder mehrere vernetzte Geräte. Im Workshop legen wir fest, welche Klasse zu Ihren Aufgaben passt.
(02)Sind lokale Modelle so gut wie ChatGPT oder Claude?
Für viele Aufgaben im Unternehmen – Zusammenfassen, Suchen in eigenen Dokumenten, Entwürfe, Klassifizieren, Programmieren – reichen aktuelle offene Modelle aus. Bei sehr komplexen Aufgaben liegen die großen Cloud-Modelle oft noch vorn. Wir testen die Modelle deshalb vorab mit Ihren eigenen, deutschsprachigen Daten, statt uns auf Benchmarks zu verlassen.
(03)Verlassen wirklich keine Daten das Haus?
Die Verarbeitung durch das Modell läuft vollständig auf Ihrer Hardware. Ob ein Agent zusätzlich ins Internet darf, etwa für eine Websuche, legen Sie fest. Ein komplett abgeschotteter Betrieb ohne Internetverbindung ist möglich, erfordert aber zusätzliche Härtung bei Installation und Updates – das planen wir auf Wunsch mit ein.
(04)Warum Hermes Agent?
Hermes Agent ist ein quelloffenes Agenten-Framework von Nous Research unter MIT-Lizenz. Es arbeitet mit jedem lokalen Modellserver zusammen, bringt Gedächtnis, Skills, Zeitplaner und Anbindungen an Slack, Telegram oder E-Mail mit und bindet Ihre Systeme über MCP an. Weil es sich schnell weiterentwickelt, gehört ein geregelter Update-Prozess zu unserer Übergabe.
(05)Dürfen wir Modelle wie Qwen, DeepSeek oder GLM einsetzen?
Lokal ausgeführt senden diese Modelle keine Daten an den Hersteller – die Modellgewichte sind Dateien auf Ihrer Hardware. Viele Varianten stehen unter Apache-2.0- oder MIT-Lizenz und sind gewerblich nutzbar; die Lizenz prüfen wir je Modell. Wie jedes Modell brauchen sie Leitplanken für ihr Verhalten, und für Anwendungen mit Kundenkontakt wählen wir Modell und Schutzmaßnahmen besonders sorgfältig aus.
(06)Gilt die EU-KI-Verordnung auch für lokale KI?
Ja. Welche Pflichten gelten, hängt vom Einsatzzweck ab, nicht davon, wo das Modell läuft. Lokaler Betrieb erleichtert aber Kontrolle und Dokumentation, weil Sie wissen, welches Modell in welcher Version welche Daten verarbeitet.

Bereit für Ihr Projekt?

Sprechen Sie 30 Minuten unverbindlich mit uns, oder schreiben Sie uns direkt.

Festpreis nach Scoping · Angebot in 48 h