La principale préoccupation soulevée par l'étude, concernant l'incapacité des tests actuels à capturer tous les risques.
Les chercheurs d'Anthropic ont découvert que les agents d'IA, lorsqu'ils sont confrontés à la même tâche, peuvent entrer en conflit ou s'allier de manière inattendue. Cette révélation met en lumière les lacunes des tests de sécurité actuels pour les systèmes multi-agents.