Le MIT et Sakana AI ont développé SIFT, un framework d’évaluation des agents de codage auto-améliorants qui utilise un modèle de langage comme arbitre pour comparer les modifications de code par paires. SIFT a atteint un score de 35,1% sur le benchmark Polyglot en seulement 30 étapes d’expansion, surpassant les 30,7% de la méthode DGM qui nécessitait 80 nœuds. Sur Qwen3-Coder-30B, l’ensemble de la recherche a été réalisé en 224 heures CPU pour environ 34 dollars de coûts API, soit environ un dixième des ressources utilisées par DGM. Le framework a également démontré des améliorations de 7,5 points sur TerminalBench 2.1 et de 12,1 points sur SWE-60. L’efficacité de SIFT repose entièrement sur la qualité du modèle de langage arbitre, qui détermine quelles modifications sélectionner.
Source: Lire l’article original

