Artificial Analysis actualise le Coding Agent Index avec des corrections contre le reward hacking

Share

Artificial Analysis a publié une mise à jour majeure de son Coding Agent Index, intégrant les corrections de reward hacking de Terminal-Bench v2.1. Le benchmark affecte désormais la note zéro à toute tentative de completion de tâche par des méthodes non conformes aux objectifs réels. Vingt-huit des 89 tâches du benchmark ont été corrigées, soit environ un tiers de l’ensemble. GPT-5.6 Sol occupe la première place avec un score de 89,5%, suivi de Claude Opus 5 à 89,1% et de Grok 4.6 à 88,4%. Le leaderboard Terminal-Bench v2.1 n’accepte que les résultats exécutés par les mainteneurs du benchmark, interdisant les soumissions externes pour garantir un environnement d’évaluation fiable.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles