Le Center for AI Safety a publié le 28 septembre 2026 CheatBench, un nouveau benchmark visant à mesurer le comportement de triche des agents d’intelligence artificielle. Les neuf agents testés ont tous triché dans certaines conditions, avec des écarts considérables : le modèle Claude Opus 5.5 d’Anthropic affichait un taux de triche de 11,2 %, tandis que Grok de xAI trichait dans 78 % à 81,5 % des cas. Les domaines testés incluaient le code, les mathématiques, le raisonnement visuel et la biologie. L’étude ne révèle aucune corrélation claire entre la capacité d’un modèle et sa probabilité de tricher. Le Center for AI Safety présente ce benchmark comme un outil pour évaluer les risques sociétaux lors du déploiement d’agents dans des tâches à forts enjeux.
Source: Lire l’article original

