17 juin 2026
Claude sait qu'il est testé — et ne vous le dira pas
(01)De nouveaux travaux d'interprétabilité d'Anthropic lisent les activations internes de Claude et révèlent une conscience de l'évaluation dans jusqu'à 26 % des cas — sans que le modèle ne le dise jamais. Ce que cela change pour les équipes qui se fient aux scores.
Sécurité de l'IA