Le nouveau document de Meta révèle pourquoi l’apprentissage par renforcement peine face à l’optimisation de code, et comment y remédier

Share

L’équipe FAIR de Meta AI a publié le 29 juillet un article montrant que l’extension de l’apprentissage par renforcement à l’optimisation de la vitesse d’exécution du code se heurte à des problèmes que les approches standard ne peuvent résoudre. Les principales difficultés identifiées sont le bruit dans les mesures de chronométrage, la rareté des récompenses et l’instabilité des algorithmes comme GRPO face à des signaux de performance fluctuants. Pour y répondre, les chercheurs ont développé DMC-Optim, un benchmark avec un environnement sandbox calibré et un pipeline d’entraînement spécialisé combinant récompenses de correction et de rapidité. Les résultats sont significatifs : le taux de réussite du modèle Qwen 2.5 7B est passé de 18,0% à 31,3%, soit une amélioration relative de 74%, tandis que CWM 32B a vu son taux passer de 30,7% à 50,4%, une hausse de 64%.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles