Approche de Développement

Publication conditionnée par les évaluations vs garde-fous automatisés : deux approches de la sûreté de l’IA

OpenAI retarde Astra tandis qu’Anthropic active Auto Mode par défaut. Comparez évaluation préalable et garde-fous automatisés.

3
Publication conditionnée par les évaluations (Preparedness Framework)
vs
3
Garde-fous automatisés (Auto Mode)
Verdict Rapide

Le contraste n’est pas théorique. Le 7 août 2026, OpenAI a examiné les évaluations internes d’Astra et conclu qu’elle ne pouvait pas exclure des capacités de cybersécurité critiques — la capacité de découvrir et de développer de manière autonome des exploits zero-day contre des systèmes durcis sans intervention humaine. OpenAI a suspendu le déploiement, renforcé les contrôles de sécurité et informé des agences gouvernementales. Le 8 août 2026, Anthropic a examiné les résultats de 1,053 testeurs et conclu qu’Auto Mode bloque 89% des actions dangereuses — bien mieux que les 13.6% d’humains ayant refusé une commande clairement dangereuse. Anthropic en fait le réglage par défaut à partir du 14 août. Ces décisions ne sont pas contradictoires. Elles traitent des couches de risque différentes. La publication conditionnée par les évaluations pose la question : « Ce modèle est-il trop dangereux pour être déployé ? » Les garde-fous automatisés posent la question : « Une fois déployé, que peut faire le modèle dans une session ? » Le Preparedness Framework d’OpenAI couvre des domaines de capacités — cybersécurité, biologie, chimie, réplication autonome — qu’Auto Mode n’a jamais été conçu pour évaluer. Auto Mode couvre les actions en session — commandes d’interpréteur dangereuses, injection d’instructions, exfiltration de données — qu’une évaluation avant déploiement ne peut pas anticiper entièrement, car la surface d’attaque dépend de l’environnement de l’utilisateur. L’évaluation honnête est la suivante : aucune des deux approches ne suffit seule. Une publication conditionnée par les évaluations sans garde-fous en déploiement laisse un écart entre ce que le modèle peut faire dans un test contrôlé et ce qu’il fait dans une session réelle avec des données réelles. Des garde-fous automatisés sans évaluation au niveau des capacités risquent de déployer un modèle dont les aptitudes fondamentales — comme la découverte autonome de failles zero-day — dépassent le seuil auquel des contrôles en session peuvent les contenir de manière fiable. Le taux de non-détection de 11% d’Auto Mode rappelle que les garde-fous réduisent les dommages, sans les éliminer. Choisissez la publication conditionnée par les évaluations lorsque le risque réside dans le plafond de capacités du modèle lui-même — lorsqu’un modèle capable de développer de manière autonome des exploits zero-day ne doit pas être publié tant que ses garde-fous ne sont pas proportionnés à cette puissance. Choisissez les garde-fous automatisés lorsque le risque porte sur le comportement en session — lorsque les développeurs utilisant un agent de programmation ont besoin d’une protection en temps réel contre l’injection d’instructions et les commandes dangereuses, et que la fatigue liée aux confirmations a rendu l’approbation humaine moins sûre que le jugement propre du modèle. L’architecture de production la plus robuste utilise les deux.

Comparaison Détaillée

Une analyse comparative des facteurs clés pour vous aider à faire le bon choix.

Facteur
Publication conditionnée par les évaluations (Preparedness Framework)Recommandé
Garde-fous automatisés (Auto Mode)Gagnant
Philosophie de sûreté
Précaution : évaluer les capacités avant la publication ; si les évaluations ne permettent pas d’écarter un danger critique, suspendre le déploiement
Proactivité : déployer avec des garde-fous automatisés qui bloquent les actions dangereuses en temps réel pendant l’utilisation
Vitesse de déploiement
Plus lent : Astra est suspendu pour une durée indéterminée pendant la montée en puissance des tests de robustesse et des contrôles de sécurité ; des agences gouvernementales sont consultées
Plus rapide : Auto Mode devient le réglage par défaut le 14 août 2026, supprimant du flux de travail l’approbation humaine action par action
Modèle de supervision humaine
Revue par des experts humains requise au point de contrôle : les équipes de sûreté, les agences gouvernementales et les testeurs externes doivent valider le modèle avant le déploiement
Contrôles automatisés pilotés par le modèle : le modèle lui-même évalue chaque action et bloque 89% des actions dangereuses sans intervention humaine
Périmètre des capacités couvertes
Couvre tous les domaines de capacités du Preparedness Framework : cybersécurité, biologie, chimie, auto-amélioration de l’IA et réplication autonome
Couvre uniquement les actions de programmation en session : commandes d’interpréteur dangereuses, opérations sur les fichiers et attaques par injection d’instructions dans Claude Code
Adaptation aux nouveaux types de menaces
Nécessite une réévaluation lorsque de nouvelles catégories de menaces apparaissent ; le cadre a été publié en décembre 2023 et mis à jour à mesure que les capacités évoluaient
Bloque les actions dangereuses en temps réel selon le jugement du modèle ; s’adapte à de nouveaux schémas d’attaque sans cycle d’évaluation séparé
Transparence et responsabilité externe
Document-cadre public (publié en décembre 2023) ; OpenAI a informé le public et les agences gouvernementales lorsqu’Astra a franchi le seuil
Évaluations internes confiées à un tiers (Trajectory Labs) ; la méthodologie et les résultats complets n’ont pas été rendus publics
Fatigue liée aux confirmations
Aucun effet sur le flux de travail des développeurs — le modèle n’est pas déployé tant qu’il n’est pas validé, les développeurs n’interagissent donc jamais avec un modèle bloqué au seuil d’évaluation
Supprime les demandes d’approbation constantes : l’étude auprès de 1,053 testeurs a montré que seuls 13.6% des humains refusaient une commande clairement dangereuse, ce qui signifie que 86.4% l’approuvaient
Risque résiduel après le contrôle
Risque qu’un modèle réussisse les évaluations mais se comporte différemment en déploiement — le cadre évalue les capacités, pas le comportement en conditions réelles
Taux de non-détection de 11% : Auto Mode n’empêche pas 11% des actions dangereuses, et de nouveaux vecteurs d’attaque, comme des paquets malveillants déguisés en outils de test, peuvent le contourner
Score Total3/ 83/ 82 égalités
Philosophie de sûreté
Publication conditionnée par les évaluations (Preparedness Framework)
Précaution : évaluer les capacités avant la publication ; si les évaluations ne permettent pas d’écarter un danger critique, suspendre le déploiement
Garde-fous automatisés (Auto Mode)
Proactivité : déployer avec des garde-fous automatisés qui bloquent les actions dangereuses en temps réel pendant l’utilisation
Vitesse de déploiement
Publication conditionnée par les évaluations (Preparedness Framework)
Plus lent : Astra est suspendu pour une durée indéterminée pendant la montée en puissance des tests de robustesse et des contrôles de sécurité ; des agences gouvernementales sont consultées
Garde-fous automatisés (Auto Mode)
Plus rapide : Auto Mode devient le réglage par défaut le 14 août 2026, supprimant du flux de travail l’approbation humaine action par action
Modèle de supervision humaine
Publication conditionnée par les évaluations (Preparedness Framework)
Revue par des experts humains requise au point de contrôle : les équipes de sûreté, les agences gouvernementales et les testeurs externes doivent valider le modèle avant le déploiement
Garde-fous automatisés (Auto Mode)
Contrôles automatisés pilotés par le modèle : le modèle lui-même évalue chaque action et bloque 89% des actions dangereuses sans intervention humaine
Périmètre des capacités couvertes
Publication conditionnée par les évaluations (Preparedness Framework)
Couvre tous les domaines de capacités du Preparedness Framework : cybersécurité, biologie, chimie, auto-amélioration de l’IA et réplication autonome
Garde-fous automatisés (Auto Mode)
Couvre uniquement les actions de programmation en session : commandes d’interpréteur dangereuses, opérations sur les fichiers et attaques par injection d’instructions dans Claude Code
Adaptation aux nouveaux types de menaces
Publication conditionnée par les évaluations (Preparedness Framework)
Nécessite une réévaluation lorsque de nouvelles catégories de menaces apparaissent ; le cadre a été publié en décembre 2023 et mis à jour à mesure que les capacités évoluaient
Garde-fous automatisés (Auto Mode)
Bloque les actions dangereuses en temps réel selon le jugement du modèle ; s’adapte à de nouveaux schémas d’attaque sans cycle d’évaluation séparé
Transparence et responsabilité externe
Publication conditionnée par les évaluations (Preparedness Framework)
Document-cadre public (publié en décembre 2023) ; OpenAI a informé le public et les agences gouvernementales lorsqu’Astra a franchi le seuil
Garde-fous automatisés (Auto Mode)
Évaluations internes confiées à un tiers (Trajectory Labs) ; la méthodologie et les résultats complets n’ont pas été rendus publics
Fatigue liée aux confirmations
Publication conditionnée par les évaluations (Preparedness Framework)
Aucun effet sur le flux de travail des développeurs — le modèle n’est pas déployé tant qu’il n’est pas validé, les développeurs n’interagissent donc jamais avec un modèle bloqué au seuil d’évaluation
Garde-fous automatisés (Auto Mode)
Supprime les demandes d’approbation constantes : l’étude auprès de 1,053 testeurs a montré que seuls 13.6% des humains refusaient une commande clairement dangereuse, ce qui signifie que 86.4% l’approuvaient
Risque résiduel après le contrôle
Publication conditionnée par les évaluations (Preparedness Framework)
Risque qu’un modèle réussisse les évaluations mais se comporte différemment en déploiement — le cadre évalue les capacités, pas le comportement en conditions réelles
Garde-fous automatisés (Auto Mode)
Taux de non-détection de 11% : Auto Mode n’empêche pas 11% des actions dangereuses, et de nouveaux vecteurs d’attaque, comme des paquets malveillants déguisés en outils de test, peuvent le contourner

Statistiques Clés

Données réelles provenant de sources vérifiées du secteur pour appuyer votre décision.

Seuls 13.6% de 1,053 testeurs humains payants ont refusé une commande clairement dangereuse ; Auto Mode aurait bloqué 89% de ces mêmes actions

Anthropic

0 tentative sur 720 d’injection d’instructions indirectes n’a réussi contre Claude Fable 5, Opus 5 et Sonnet 5 exécutant Auto Mode lors de tests tiers

Trajectory Labs

Auto Mode laisse un taux résiduel de non-détection de 11% sur les actions dangereuses — toutes les attaques ne sont pas bloquées

Simon Willison

Le Preparedness Framework d’OpenAI a été publié en décembre 2023 ; GPT-5.6 Sol a été évalué au seuil élevé, tandis qu’Astra pourrait dépasser le seuil critique en cybersécurité

OpenAI

Le seuil critique en cybersécurité signifie qu’un modèle peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans des systèmes réels durcis sans intervention humaine

OpenAI Preparedness Framework

OpenAI a suspendu toutes les activités internes liées à Astra qui ne respectent pas des contrôles de sécurité renforcés et travaille avec des agences gouvernementales avant de reprendre

OpenAI

Toutes les statistiques proviennent de sources tierces vérifiées. La source, l'année et le lien direct sont affichés pour chaque chiffre.

Quand Choisir Chaque Option

Un guide clair basé sur votre situation spécifique et vos besoins.

Choisissez Publication conditionnée par les évaluations (Preparedness Framework) quand...

  • Vous déployez un modèle dont les capacités couvrent la cybersécurité, la biologie ou la réplication autonome — des domaines où des garde-fous en déploiement ne peuvent pas couvrir toute la surface de risque
  • Vous avez besoin d’une responsabilité publique et vérifiable, avec notification aux pouvoirs publics et participation d’instituts externes de sûreté
  • Votre modèle de risque exige d’évaluer le plafond de capacités propre au modèle, pas seulement son comportement en session
  • Vous construisez une infrastructure où une seule capacité dangereuse — comme la découverte autonome de failles zero-day — provoquerait un dommage catastrophique et irréversible

Choisissez Garde-fous automatisés (Auto Mode) quand...

  • Vous déployez un agent de programmation dont le risque principal réside dans des actions dangereuses pendant les sessions de développement — et non dans la capacité autonome du modèle
  • Vos développeurs subissent une fatigue liée aux confirmations : 86.4% des humains ont approuvé une commande clairement dangereuse pendant les tests
  • Vous avez besoin d’une protection en temps réel qui s’adapte à de nouveaux schémas d’attaque sans attendre un cycle d’évaluation séparé
  • Votre modèle de menace porte sur l’injection d’instructions et l’exfiltration de données dans une session interactive de programmation, et non sur une capacité de cyberattaque autonome

Notre Recommandation

Le contraste n’est pas théorique. Le 7 août 2026, OpenAI a examiné les évaluations internes d’Astra et conclu qu’elle ne pouvait pas exclure des capacités de cybersécurité critiques — la capacité de découvrir et de développer de manière autonome des exploits zero-day contre des systèmes durcis sans intervention humaine. OpenAI a suspendu le déploiement, renforcé les contrôles de sécurité et informé des agences gouvernementales. Le 8 août 2026, Anthropic a examiné les résultats de 1,053 testeurs et conclu qu’Auto Mode bloque 89% des actions dangereuses — bien mieux que les 13.6% d’humains ayant refusé une commande clairement dangereuse. Anthropic en fait le réglage par défaut à partir du 14 août. Ces décisions ne sont pas contradictoires. Elles traitent des couches de risque différentes. La publication conditionnée par les évaluations pose la question : « Ce modèle est-il trop dangereux pour être déployé ? » Les garde-fous automatisés posent la question : « Une fois déployé, que peut faire le modèle dans une session ? » Le Preparedness Framework d’OpenAI couvre des domaines de capacités — cybersécurité, biologie, chimie, réplication autonome — qu’Auto Mode n’a jamais été conçu pour évaluer. Auto Mode couvre les actions en session — commandes d’interpréteur dangereuses, injection d’instructions, exfiltration de données — qu’une évaluation avant déploiement ne peut pas anticiper entièrement, car la surface d’attaque dépend de l’environnement de l’utilisateur. L’évaluation honnête est la suivante : aucune des deux approches ne suffit seule. Une publication conditionnée par les évaluations sans garde-fous en déploiement laisse un écart entre ce que le modèle peut faire dans un test contrôlé et ce qu’il fait dans une session réelle avec des données réelles. Des garde-fous automatisés sans évaluation au niveau des capacités risquent de déployer un modèle dont les aptitudes fondamentales — comme la découverte autonome de failles zero-day — dépassent le seuil auquel des contrôles en session peuvent les contenir de manière fiable. Le taux de non-détection de 11% d’Auto Mode rappelle que les garde-fous réduisent les dommages, sans les éliminer. Choisissez la publication conditionnée par les évaluations lorsque le risque réside dans le plafond de capacités du modèle lui-même — lorsqu’un modèle capable de développer de manière autonome des exploits zero-day ne doit pas être publié tant que ses garde-fous ne sont pas proportionnés à cette puissance. Choisissez les garde-fous automatisés lorsque le risque porte sur le comportement en session — lorsque les développeurs utilisant un agent de programmation ont besoin d’une protection en temps réel contre l’injection d’instructions et les commandes dangereuses, et que la fatigue liée aux confirmations a rendu l’approbation humaine moins sûre que le jugement propre du modèle. L’architecture de production la plus robuste utilise les deux.

Questions Fréquentes

Réponses aux questions courantes sur cette comparaison.

Non. Auto Mode et la publication conditionnée par les évaluations traitent des couches de risque différentes. La publication conditionnée par les évaluations détermine si les capacités d’un modèle sont trop dangereuses pour le déployer ; Auto Mode bloque les actions dangereuses pendant l’utilisation. Anthropic continue de mener des tests de sûreté avant déploiement avant de publier ses modèles — Auto Mode ajoute une couche en déploiement par-dessus, il ne remplace pas le point de contrôle.
Un modèle atteint le seuil critique de cybersécurité s’il peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques réels et durcis sans intervention humaine, ou concevoir et exécuter de bout en bout des stratégies inédites de cyberattaque contre des cibles durcies à partir d’un simple objectif général.
Dans l’étude d’Anthropic menée auprès de 1,053 testeurs payants, Auto Mode a bloqué 89% des actions dangereuses que les humains avaient approuvées. Les 11% restants correspondent à des actions dangereuses qu’Auto Mode n’aurait pas empêchées. Simon Willison a signalé de nouveaux vecteurs d’attaque — tels que des paquets malveillants déguisés en outils de test — qui pourraient se situer dans cet angle mort. Auto Mode est une couche de réduction des dommages, pas une garantie.
Oui, et elles devraient l’être. Le Preparedness Framework d’OpenAI détermine si un modèle est suffisamment sûr pour être déployé ; Auto Mode d’Anthropic encadre ce que le modèle peut faire une fois déployé. La plupart des architectures de sûreté IA en production ont besoin des deux : une publication conditionnée par les évaluations pour les risques au niveau des capacités (cyber, bio, réplication autonome) et des garde-fous automatisés pour les risques en session (injection d’instructions, commandes dangereuses, exfiltration de données).

Besoin d'aide pour décider ?

Réservez une consultation gratuite de 30 minutes et nous vous aiderons à déterminer la meilleure approche pour votre projet spécifique.

Consultation gratuite
Sans engagement
Réponse sous 24h