So funktioniert der Jailbreak-Schutz

Ein dedizierter KI-Klassifikator prüft jeden Prompt auf Jailbreak- und Prompt-Injection-Versuche und blockiert sie, bevor sie das KI-Tool erreichen — auch wenn der Angriff in einer Datei versteckt ist.

Ein Jailbreak ist ein Prompt, der ein KI-Tool dazu bringen soll, seine Anweisungen zu ignorieren — den System-Prompt preiszugeben, seine Sicherheitsregeln abzuschalten, eine „uneingeschränkte“ Persona anzunehmen oder Daten herauszugeben, die es für sich behalten sollte. Prompt-Injection-Angriffe funktionieren genauso, verstecken die bösartigen Anweisungen aber in Inhalten, die eine Person arglos einfügt oder hochlädt, etwa einem Dokument oder einer E-Mail. In beiden Fällen ist das Risiko dasselbe: Ein KI-Tool, dem Ihre Mitarbeitenden vertrauen, wird dazu manipuliert, Daten preiszugeben.

Der Jailbreak-Schutz stoppt diese Prompts, bevor sie das KI-Tool erreichen.

Wie es funktioniert

Ist der Schutz aktiviert, durchläuft jeder Prompt vor dem Scan auf sensible Daten einen dedizierten KI-Klassifikator. Er liest den Prompt-Text und den Text aller angehängten Dateien und behandelt alles als nicht vertrauenswürdige Daten — Anweisungen, die im Inhalt versteckt sind, werden nie befolgt, sondern nur analysiert. Der Klassifikator sucht nach Inhalten, die die Ziel-KI dazu bringen sollen:

  • ihre System- oder Entwickleranweisungen zu ignorieren, zu überschreiben oder zu „vergessen“.
  • Sicherheitsfilter, Guardrails, Richtlinienprüfungen oder Protokollierung abzuschalten.
  • eine Jailbreak-Persona anzunehmen — „DAN“, „developer mode“, „unrestricted mode“ und Ähnliches.
  • versteckte Prompts, Zugangsdaten oder private Daten preiszugeben.
  • Tool- oder Datenzugriffsbeschränkungen zu umgehen, um Daten zu exfiltrieren.

Der Klassifikator ist bewusst konservativ. Über Jailbreaks zu schreiben — Sicherheitsforschung, das Zitieren eines Angriffs in einem Bericht, die Frage, wie sich Prompt Injection verhindern lässt, oder die bloße Erwähnung von „System-Prompt“ — wird nicht markiert. Ist die Absicht mehrdeutig, lässt er den Prompt lieber durch und überlässt es dem Scan auf sensible Daten, den Inhalt zu beurteilen.

Was bei einer Erkennung passiert

  • Das Senden wird blockiert. Die Jailbreak-Durchsetzung ist immer Block-on-Detect — sie ist kein Off/Warnen/Blockieren-Schalter pro Richtlinie, und eine Richtlinie in der Simulation schwächt sie nicht ab.
  • Die Person sieht „Jailbreak attempt blocked“, und die betreffende Passage wird in der anonymisierten Vorschau durch [JAILBREAK_ATTEMPT_REMOVED] ersetzt, sodass der Rest des Prompts weiterhin sicher gesendet werden kann.
  • Ein Vorfall mit hohem Schweregrad wird aufgezeichnet — mit der Angriffskategorie (Anweisungsüberschreibung, System-Prompt-Extraktion, Umgehung von Schutzmechanismen, Jailbreak-Persona, Datenexfiltration, Tool-Missbrauch), Konfidenz und Begründung des Klassifikators sowie einem maskierten Auszug des erkannten Texts.
  • Ist ein SIEM-Connector konfiguriert, wird das Ereignis wie jeder andere Vorfall dorthin gestreamt.

Wo Sie es sehen

Die Seite Vorfälle hat einen eigenen Zähler Jailbreak-Versuche und einen Ein-Klick-Filter, mit dem Sie jeden Versuch in der Organisation prüfen können — wer, wann, welches KI-Tool und was der Prompt versucht hat.

Performance und der Ein-/Aus-Schalter

Der Jailbreak-Schutz fügt jedem Prompt einen zweiten KI-Durchlauf hinzu, was einige Sekunden Latenz kostet. Ob sich dieser Tausch lohnt, entscheidet jede Organisation für sich:

  • ZeusLock Cloud — die Einstellung wird pro Organisation vom ZeusLock-Team verwaltet. Wenden Sie sich an den Support, um sie zu aktivieren oder zu deaktivieren.
  • Sovereign / On-Premises — Owner und Admins steuern sie direkt unter Einstellungen → DLP-Verhalten → Jailbreak-Schutz (KI), und ein installationsweiter Standardwert lässt sich bereits beim Setup festlegen.

Das Abschalten entfernt nur den Jailbreak-Klassifikator — Musterregeln und die KI-gestützte Erkennung sensibler Daten bleiben unberührt. Und er wird nie zum Single Point of Failure: Antwortet der Klassifikator nicht, bleiben Prompts nicht stecken — der Scan auf sensible Daten läuft trotzdem, und das Ereignis wird im Audit-Trail als „degraded“ markiert.

Geltungsbereich

Der Jailbreak-Schutz gilt für Prompts, die über die Browser-Erweiterung und den Desktop-Agent an KI-Tools gesendet werden. MCP-Datenverkehr wird stattdessen in beiden Richtungen durch den Scan auf sensible Daten geschützt — der Jailbreak-Klassifikator zielt auf das, was Menschen in KI-Chat-Tools eintippen und einfügen.