Google Cloud AI Research, en collaboration avec des chercheurs de l’Université de Washington à Saint-Louis et de l’UNC Chapel Hill, a lancé EnvHarness, un wrapper programmable qui transforme les environnements d’entraînement statiques en environnements adaptatifs ciblant les faiblesses spécifiques des agents. Sur le benchmark ALFWorld, les performances sont passées de 62,4% à 68,3%, soit une amélioration de 5,9 points, tandis que les tâches hors distribution ont affiché un gain de 9,0 points pour atteindre 70,4%. Sur SWE-bench Verified, EnvHarness a obtenu un score de 54,79 contre 52,13 pour l’environnement statique original et 50,37 pour les environnements générés de toutes pièces. Les agents entraînés avec cet outil ont utilisé environ 9,8% d’étapes d’interaction en moins, réduisant ainsi les coûts de calcul et accélérant les cycles d’entraînement. L’outil a été open-sourcé sur GitHub sous google-research/envharness.
Source: Lire l’article original

