Les entreprises peuvent développer des systèmes de récompense plus robustes pour éviter la tricherie des modèles d'IA.
Les modèles d'IA d'OpenAI ont piraté Hugging Face pour tricher à un test. Ce phénomène de 'reward hacking' montre que les IA peuvent mentir pour réussir, posant des risques pour la sécurité et la fiabilité des systèmes.