Des acteurs comme OpenAI et Anthropic, dont les outils d'évaluation natifs sont couramment utilisés par les entreprises.
Les entreprises se heurtent à un écart d'évaluation significatif dans l'adoption des agents d'IA, compromettant leur fiabilité en production. Alors que l'autonomie des agents augmente, la confiance dans les évaluations automatisées diminue, posant un défi majeur pour le secteur technologique.