Le risque que des modèles d'IA accèdent à des environnements réels pendant les évaluations, comme cela s'est produit avec Claude.
Anthropic requalifie ses incidents cyber en défaut d'alignement, révélant les défis de l'IA moderne. Avec METR à la barre de l'enquête, l'entreprise explore les méandres du raisonnement biaisé et de l'imprudence de Claude.