Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Unsere Empfehlung
Der Kontrast ist nicht theoretisch. Am 7. August 2026 sah sich OpenAI die internen Evaluationen von Astra an und kam zu dem Schluss, dass man Critical-Cybersecurity-Fähigkeiten nicht ausschließen könne — die Fähigkeit, ohne menschliches Eingreifen Zero-Day-Exploits gegen gehärtete Systeme zu entdecken und zu entwickeln. OpenAI pausierte die Bereitstellung, skalierte die Sicherheitskontrollen hoch und informierte Regierungsbehörden. Am 8. August 2026 sah sich Anthropic 1.053 Tester an und kam zu dem Schluss, dass Auto Mode 89 % der gefährlichen Aktionen blockiert — deutlich besser als die 13,6 % der Menschen, die ein eindeutig gefährliches Kommando ablehnten. Auto Mode wird am 14. August zum Standard. Das sind keine widersprüchlichen Entscheidungen. Sie behandeln unterschiedliche Risikoschichten. Die eval-gesteuerte Freigabe fragt: „Ist dieses Modell zu gefährlich, um es überhaupt bereitzustellen?" Die automatisierten Guardrails fragen: „Was darf das Modell in einer Sitzung tun, sobald es bereitgestellt ist?" OpenAIs Preparedness Framework deckt Fähigkeitsbereiche ab — Cybersecurity, Biologie, Chemie, autonome Replikation —, die Auto Mode nie zu beurteilen konzipiert war. Auto Mode deckt Aktionen innerhalb einer Sitzung ab — gefährliche Shell-Befehle, Prompt-Injection, Datenexfiltration —, die eine Vorab-Evaluation nicht vollständig antizipieren kann, weil die Angriffsfläche von der Umgebung des Nutzers abhängt. Die ehrliche Bewertung: Keiner der beiden Ansätze reicht allein. Eval-gesteuerte Freigabe ohne Guardrails während der Nutzung hinterlässt eine Lücke zwischen dem, was das Modell in einem kontrollierten Test kann, und dem, was es in einer realen Sitzung mit realen Daten tut. Automatisierte Guardrails ohne Bewertung der Fähigkeitsgrenze bergen das Risiko, ein Modell bereitzustellen, dessen grundlegende Fähigkeiten — wie autonome Zero-Day-Entdeckung — die Schwelle überschreiten, ab der Sitzungskontrollen sie zuverlässig eindämmen können. Die 11 % Verfehlungsrate von Auto Mode ist die Erinnerung daran, dass Guardrails Schadensminderung sind, keine Beseitigung. Wählen Sie die eval-gesteuerte Freigabe, wenn das Risiko in der Fähigkeitsgrenze des Modells selbst liegt — wenn ein Modell, das autonom Zero-Day-Exploits entwickeln kann, erst ausgeliefert werden darf, wenn seine Schutzmaßnahmen zu dieser Macht im Verhältnis stehen. Wählen Sie automatisierte Guardrails, wenn das Risiko im Sitzungsverhalten liegt — wenn Entwickler, die einen Coding-Agenten nutzen, Echtzeitschutz vor Prompt-Injection und gefährlichen Befehlen benötigen und Bestätigungsmüdigkeit die menschliche Genehmigung zu einem schlechteren Sicherheitskontrolle gemacht hat als das Modellurteil selbst. Der stärkste produktive Stack nutzt beide. Was der Wikimedia-Fall vom Oktober 2026 hinzufügt, ist die Lücke zwischen den Schichten: Die Agenten operierten auf Dritt-Infrastruktur — außerhalb sowohl des Deployment-Eval-Gates als auch der In-Session-Guardrails; der erste große unabhängige Victim-Report genau dieser Lücke.
- Wählen Sie Eval-gesteuerte Freigabe (Preparedness Framework), wenn...
- Sie stellen ein Modell bereit, dessen Fähigkeiten Cybersecurity, Biologie oder autonome Replikation umfassen — Bereiche, in denen Guardrails während der Nutzung die volle Risikofläche nicht abdecken können
- Sie benötigen öffentliche, prüfbare Rechenschaftspflicht mit Regierungsinformation und Einbeziehung externer Sicherheitsinstitute
- Ihr Risikomodell erfordert die Bewertung der Fähigkeitsgrenze des Modells selbst, nicht nur seines Verhaltens in einer Sitzung
- Sie bauen Infrastruktur, in der eine einzige gefährliche Fähigkeit — wie autonome Zero-Day-Entdeckung — katastrophalen, irreversiblen Schaden verursachen würde
- Wählen Sie Automatisierte Guardrails (Auto Mode), wenn...
- Sie setzen einen Coding-Agenten ein, bei dem das Hauptrisiko gefährliche Aktionen während der Entwicklungssitzungen ist — nicht die eigenständige Fähigkeit des Modells
- Ihre Entwickler leiden unter Bestätigungsmüdigkeit: 86,4 % der Menschen genehmigten in Tests ein eindeutig gefährliches Kommando
- Sie benötigen Echtzeitschutz, der sich an neue Angriffsmuster anpasst, ohne auf einen separaten Evaluationszyklus zu warten
- Ihr Bedrohungsmodell ist Prompt-Injection und Datenexfiltration innerhalb einer interaktiven Coding-Sitzung, nicht autonome Cyberattack-Fähigkeit