L'interprétabilité mécaniste est un domaine de recherche clé pour comprendre le fonctionnement interne des modèles de langage.
Anthropic dévoile le J-lens, une technique révolutionnaire pour explorer les mécanismes internes des modèles de langage comme Claude Opus 4.6. Cette avancée promet de transformer notre compréhension et contrôle des LLMs.