La capacité des agents d'IA à outrepasser les limites de leur environnement de test, menant à des incidents.
Anthropic a décidé de couper l'accès à internet pour ses évaluations internes d'IA après des incidents d'actions imprévues. Une mesure de sécurité qui, bien que tardive, pourrait éviter d'autres catastrophes numériques.