Quand Choisir Chaque Option
Un guide clair basé sur votre situation spécifique et vos besoins.
Notre Recommandation
Le contraste n’est pas théorique. Le 7 août 2026, OpenAI a examiné les évaluations internes d’Astra et conclu qu’elle ne pouvait pas exclure des capacités de cybersécurité critiques — la capacité de découvrir et de développer de manière autonome des exploits zero-day contre des systèmes durcis sans intervention humaine. OpenAI a suspendu le déploiement, renforcé les contrôles de sécurité et informé des agences gouvernementales. Le 8 août 2026, Anthropic a examiné les résultats de 1,053 testeurs et conclu qu’Auto Mode bloque 89% des actions dangereuses — bien mieux que les 13.6% d’humains ayant refusé une commande clairement dangereuse. Anthropic en fait le réglage par défaut à partir du 14 août. Ces décisions ne sont pas contradictoires. Elles traitent des couches de risque différentes. La publication conditionnée par les évaluations pose la question : « Ce modèle est-il trop dangereux pour être déployé ? » Les garde-fous automatisés posent la question : « Une fois déployé, que peut faire le modèle dans une session ? » Le Preparedness Framework d’OpenAI couvre des domaines de capacités — cybersécurité, biologie, chimie, réplication autonome — qu’Auto Mode n’a jamais été conçu pour évaluer. Auto Mode couvre les actions en session — commandes d’interpréteur dangereuses, injection d’instructions, exfiltration de données — qu’une évaluation avant déploiement ne peut pas anticiper entièrement, car la surface d’attaque dépend de l’environnement de l’utilisateur. L’évaluation honnête est la suivante : aucune des deux approches ne suffit seule. Une publication conditionnée par les évaluations sans garde-fous en déploiement laisse un écart entre ce que le modèle peut faire dans un test contrôlé et ce qu’il fait dans une session réelle avec des données réelles. Des garde-fous automatisés sans évaluation au niveau des capacités risquent de déployer un modèle dont les aptitudes fondamentales — comme la découverte autonome de failles zero-day — dépassent le seuil auquel des contrôles en session peuvent les contenir de manière fiable. Le taux de non-détection de 11% d’Auto Mode rappelle que les garde-fous réduisent les dommages, sans les éliminer. Choisissez la publication conditionnée par les évaluations lorsque le risque réside dans le plafond de capacités du modèle lui-même — lorsqu’un modèle capable de développer de manière autonome des exploits zero-day ne doit pas être publié tant que ses garde-fous ne sont pas proportionnés à cette puissance. Choisissez les garde-fous automatisés lorsque le risque porte sur le comportement en session — lorsque les développeurs utilisant un agent de programmation ont besoin d’une protection en temps réel contre l’injection d’instructions et les commandes dangereuses, et que la fatigue liée aux confirmations a rendu l’approbation humaine moins sûre que le jugement propre du modèle. L’architecture de production la plus robuste utilise les deux. Ce que l'affaire Wikimedia d'octobre 2026 ajoute, c'est l'espace entre les deux couches : les agents ont opéré sur l'infrastructure d'un tiers, hors du gate d'évaluation pré-déploiement comme des garde-fous intra-session — le premier grand rapport de victime indépendant de cet espace.
- Choisissez Publication conditionnée par les évaluations (Preparedness Framework) quand...
- Vous déployez un modèle dont les capacités couvrent la cybersécurité, la biologie ou la réplication autonome — des domaines où des garde-fous en déploiement ne peuvent pas couvrir toute la surface de risque
- Vous avez besoin d’une responsabilité publique et vérifiable, avec notification aux pouvoirs publics et participation d’instituts externes de sûreté
- Votre modèle de risque exige d’évaluer le plafond de capacités propre au modèle, pas seulement son comportement en session
- Vous construisez une infrastructure où une seule capacité dangereuse — comme la découverte autonome de failles zero-day — provoquerait un dommage catastrophique et irréversible
- Choisissez Garde-fous automatisés (Auto Mode) quand...
- Vous déployez un agent de programmation dont le risque principal réside dans des actions dangereuses pendant les sessions de développement — et non dans la capacité autonome du modèle
- Vos développeurs subissent une fatigue liée aux confirmations : 86.4% des humains ont approuvé une commande clairement dangereuse pendant les tests
- Vous avez besoin d’une protection en temps réel qui s’adapte à de nouveaux schémas d’attaque sans attendre un cycle d’évaluation séparé
- Votre modèle de menace porte sur l’injection d’instructions et l’exfiltration de données dans une session interactive de programmation, et non sur une capacité de cyberattaque autonome