KI-Sicherheit & Leitplanken

KI-Sicherheitsfilter (AI Safety Filter)

Ein KI-Sicherheitsfilter ist eine Schutzschicht, die Eingaben, Ausgaben oder geplante Aktionen eines KI-Systems prüft, bevor sie weiterverarbeitet, angezeigt oder ausgeführt werden. Solche Filter erkennen zum Beispiel gefährliche Inhalte, Datenschutzverstöße, Prompt Injection, Jailbreak-Versuche, sensible Daten, unsichere Tool-Aufrufe oder Regelverletzungen aus einer internen Policy. Sie können vor dem Modell sitzen, nach dem Modell prüfen oder direkt in einer Agent Runtime zwischen Planung und Ausführung eingreifen. Wichtig ist die Abgrenzung: Ein Sicherheitsfilter ist nicht die gesamte Governance eines KI-Systems. Er ist ein konkreter technischer Kontrollpunkt, der entscheidet, ob ein Schritt erlaubt, blockiert, maskiert, eskaliert oder protokolliert wird. In einfachen Chatbots betrifft das vor allem Text. In agentischen Systemen wird der Filter kritischer, weil ein Agent Dateien lesen, APIs aufrufen, Code ändern oder externe Nachrichten senden kann. Gute KI-Sicherheitsfilter sind deshalb kontextsensitiv: Sie unterscheiden harmlose Antworten von Aktionen mit realer Wirkung, dokumentieren Blockaden nachvollziehbar und lassen menschliche Freigaben zu, statt produktive Workflows blind zu stoppen.

Im Detail: KI-Sicherheitsfilter (AI Safety Filter)

Ein KI-Sicherheitsfilter ist eine Schutzschicht, die Eingaben, Ausgaben oder geplante Aktionen eines KI-Systems prüft, bevor sie weiterverarbeitet, angezeigt oder ausgeführt werden. Solche Filter erkennen zum Beispiel gefährliche Inhalte, Datenschutzverstöße, Prompt Injection, Jailbreak-Versuche, sensible Daten, unsichere Tool-Aufrufe oder Regelverletzungen aus einer internen Policy. Sie können vor dem Modell sitzen, nach dem Modell prüfen oder direkt in einer Agent Runtime zwischen Planung und Ausführung eingreifen. Wichtig ist die Abgrenzung: Ein Sicherheitsfilter ist nicht die gesamte Governance eines KI-Systems. Er ist ein konkreter technischer Kontrollpunkt, der entscheidet, ob ein Schritt erlaubt, blockiert, maskiert, eskaliert oder protokolliert wird. In einfachen Chatbots betrifft das vor allem Text. In agentischen Systemen wird der Filter kritischer, weil ein Agent Dateien lesen, APIs aufrufen, Code ändern oder externe Nachrichten senden kann. Gute KI-Sicherheitsfilter sind deshalb kontextsensitiv: Sie unterscheiden harmlose Antworten von Aktionen mit realer Wirkung, dokumentieren Blockaden nachvollziehbar und lassen menschliche Freigaben zu, statt produktive Workflows blind zu stoppen.

Implementierungsdetails

  • Tech-Stack
  • Produktionsreife Leitplanken