Les agents d’intelligence artificielle capables d’utiliser un ordinateur ont atteint un score de 85% au benchmark OSWorld, contre seulement 12% il y a deux ans. En juin 2026, les modeles Anthropic dominent le classement : Claude Mythos Preview (85,4%), Fable 5 (85,0%) et Opus 4.8 (83,4%), surpassant tous la baseline humaine fixee a 72%. En decembre 2025, l’agent Simular S3 etait devenu le premier systeme a franchir ce seuil humain. Cependant, sur la version difficulté accrue OSWorld 2.0, qui propose des taches plus longues et plus complexes necessitant en moyenne 1,6 heure de travail humain, les meilleurs agents ne parviennent a accomplir que 20,6% des missions. Sur les versions annotees des tests, ils necessitent egalement entre 1,4 et 2,7 fois plus d’etapes qu’un etre humain pour accomplir les memes taches.
Source: Lire l’article original

