L'interprétabilité mécanistique est essentielle pour comprendre comment les modèles d'IA prennent des décisions.
Anthropic, pionnier de l'intelligence artificielle, dévoile le J-space, un espace mystérieux influençant les modèles de langage. Cette découverte prometteuse soulève autant de questions qu'elle n'apporte de réponses, notamment sur les biais et l'interprétation des IA.