La plupart des organisations ne surveillent pas la justesse des réponses des agents en production, se concentrant uniquement sur le fonctionnement du système.
Les entreprises se heurtent à un écart d'évaluation significatif dans l'adoption des agents d'IA, compromettant leur fiabilité en production. Alors que l'autonomie des agents augmente, la confiance dans les évaluations automatisées diminue, posant un défi majeur pour le secteur technologique.