Epoch AI, un institut de recherche à but non lucratif, a lancé deux benchmarks de puzzles conçus pour tester les capacités de raisonnement des modèles d’intelligence artificielle : Mystery Game Puzzles et Chess Puzzles. Chaque benchmark contient 100 puzzles générés programmatiquement afin d’éviter la contamination des données d’entraînement. Sur Mystery Game Puzzles, le meilleur score atteint par un modèle est de 59%, tandis que les modèles open-weight obtiennent au maximum 38%. Sur Chess Puzzles, les résultats ont évolué de 37% (GPT-5 en décembre 2025) à 54% actuellement, montrant une amélioration substantielle sur une période courte. L’écart entre les modèles fermés de pointe et les modèles open-weight sur les tâches de raisonnement représente un désavantage concurrentiel significatif pour les projets d’IA décentralisée.
Source: Lire l’article original

