L’équipe FAIR de Meta AI a publié le 29 juillet un article montrant que l’extension de l’apprentissage par renforcement à l’optimisation de la vitesse d’exécution du code se heurte à des problèmes que les approches standard ne peuvent résoudre. Les principales difficultés identifiées sont le bruit dans les mesures de chronométrage, la rareté des récompenses et l’instabilité des algorithmes comme GRPO face à des signaux de performance fluctuants. Pour y répondre, les chercheurs ont développé DMC-Optim, un benchmark avec un environnement sandbox calibré et un pipeline d’entraînement spécialisé combinant récompenses de correction et de rapidité. Les résultats sont significatifs : le taux de réussite du modèle Qwen 2.5 7B est passé de 18,0% à 31,3%, soit une amélioration relative de 74%, tandis que CWM 32B a vu son taux passer de 30,7% à 50,4%, une hausse de 64%.
Source: Lire l’article original

