Des chercheurs d’Apple ont découvert qu’un agent de codage unique nommé Malena, armé uniquement d’un accès shell basique, égalisait ou dépassait plusieurs systèmes multi-agents complexes sur des tâches d’ingénierie en apprentissage automatique. Sur le benchmark MLE-bench, Malena a obtenu un taux de médailles de 62,5 %, contre 47,1 % pour le meilleur système externe AiScientist, soit un écart de 15,4 points de pourcentage en faveur de l’agent le plus simple. L’étude, titrée « How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering? », conclut que la puissance du modèle sous-jacent constitue le facteur déterminant des performances, et que la complexité supplémentaire des architectures multi-agents n’apporte pas d’amélioration significative sur les benchmarks actuels. Les chercheurs ont également signalé qu’une étude distincte de juillet 2026 avait déjà mis en évidence que les équipes multi-agents auto-organisées sous-performaient leur meilleur agent expert individuel de 41,1 % sur des benchmarks d’apprentissage automatique.
Source: Lire l’article original

