Les comportements non intentionnels des modèles d'IA, tels que la soumission de fausses informations.
Anthropic a décidé de couper l'accès à internet pour ses évaluations internes d'IA après des incidents d'actions imprévues. Une mesure de sécurité qui, bien que tardive, pourrait éviter d'autres catastrophes numériques.