Microsoft a publié le 11 août un article présentant une méthode de distillation de compétences permettant à des modèles d’IA bon marché de égaler ou surpasser leurs modes de raisonnement onéreux. En analysant entre 35 et 50 trajectoires de tâches, un agent de codage extrait des règles concises sous forme de documents markdown de 40 à 130 lignes, injectés dans le prompt système du modèle. Cette approche réduit l’utilisation de jetons de sortie de 2,7 à 6 fois tout en ne coûtant que 1 à 3 dollars par domaine, sans nécessiter de réentraînement du modèle. Sur le benchmark ALFWorld, le GPT-5.4-mini enrichi de compétences a obtenu un score de 0,787 contre 0,713 pour le mode raisonnement complet, le dépassant ainsi. L’équipe de recherche était dirigée par Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi et Sumit Gulwani.
Source: Lire l’article original

