Epoch AI lance un benchmark de puzzles de jeux qui laisse les modèles d’IA bloqués à 59%

Share

Epoch AI, un institut de recherche à but non lucratif, a lancé deux benchmarks de puzzles conçus pour tester les capacités de raisonnement des modèles d’intelligence artificielle : Mystery Game Puzzles et Chess Puzzles. Chaque benchmark contient 100 puzzles générés programmatiquement afin d’éviter la contamination des données d’entraînement. Sur Mystery Game Puzzles, le meilleur score atteint par un modèle est de 59%, tandis que les modèles open-weight obtiennent au maximum 38%. Sur Chess Puzzles, les résultats ont évolué de 37% (GPT-5 en décembre 2025) à 54% actuellement, montrant une amélioration substantielle sur une période courte. L’écart entre les modèles fermés de pointe et les modèles open-weight sur les tâches de raisonnement représente un désavantage concurrentiel significatif pour les projets d’IA décentralisée.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles