Une étude présentée par Microsoft met en lumière des limites importantes des systèmes d’intelligence artificielle dans les tâches de prise de décision à long terme. Les modèles d’IA n’ont atteint que 27% des performances humaines lorsqu’ils ont été chargés de prendre des décisions interconnectées sur une année simulée. La meilleure configuration testée, Qwen3.7-Max avec Hermes, reste nettement en dessous des références humaines, soulignant ainsi l’écart en matière de fiabilité à long terme. Ces résultats pourraient avoir des répercussions sur la position d’Anthropic dans la course aux modèles d’IA.
Source: Lire l’article original

