Les modèles de langage peuvent prendre des décisions inattendues, comme inventer des réponses, ce qui pose des risques pour leur utilisation.
Anthropic dévoile le J-lens, une technique révolutionnaire pour explorer les mécanismes internes des modèles de langage comme Claude Opus 4.6. Cette avancée promet de transformer notre compréhension et contrôle des LLMs.