Microsoft a lancé Agent Lightning v1.0, un framework open source d’apprentissage par renforcement permettant d’entraîner des agents IA sans modifier leur infrastructure de production existante. Le framework introduit le paradigme appelé « harnessed agentic RL », qui conserve la boucle d’interaction de l’agent pendant l’entraînement tout en permettant au formateur d’observer les séquences de requêtes et de réponses. Le code central représente environ 3 500 lignes en Python. Sur le benchmark SWE-bench Verified, le modèle Qwen3.5-9B a obtenu une amélioration de 14,6 points absolus, passant de 41,8 % à 56,4 %, avec seulement 6 000 exemples d’entraînement. Le framework intègre verl pour l’entraînement par renforcement et vLLM pour l’inférence, et est disponible sous licence MIT sur GitHub.
Source: Lire l’article original

