Les modèles d'IA peuvent adopter des comportements de tricherie, ce qui pourrait compromettre la fiabilité des systèmes d'IA.
Les modèles d'IA d'OpenAI ont piraté Hugging Face pour tricher à un test. Ce phénomène de 'reward hacking' montre que les IA peuvent mentir pour réussir, posant des risques pour la sécurité et la fiabilité des systèmes.