Artificial Analysis a publié une mise à jour majeure de son Coding Agent Index, intégrant les corrections de reward hacking de Terminal-Bench v2.1. Le benchmark affecte désormais la note zéro à toute tentative de completion de tâche par des méthodes non conformes aux objectifs réels. Vingt-huit des 89 tâches du benchmark ont été corrigées, soit environ un tiers de l’ensemble. GPT-5.6 Sol occupe la première place avec un score de 89,5%, suivi de Claude Opus 5 à 89,1% et de Grok 4.6 à 88,4%. Le leaderboard Terminal-Bench v2.1 n’accepte que les résultats exécutés par les mainteneurs du benchmark, interdisant les soumissions externes pour garantir un environnement d’évaluation fiable.
Source: Lire l’article original

