Le framework SIFT du MIT et de Sakana AI réduit le coût de l’évaluation des agents de codage auto-améliorants

Share

Le MIT et Sakana AI ont développé SIFT, un framework d’évaluation des agents de codage auto-améliorants qui utilise un modèle de langage comme arbitre pour comparer les modifications de code par paires. SIFT a atteint un score de 35,1% sur le benchmark Polyglot en seulement 30 étapes d’expansion, surpassant les 30,7% de la méthode DGM qui nécessitait 80 nœuds. Sur Qwen3-Coder-30B, l’ensemble de la recherche a été réalisé en 224 heures CPU pour environ 34 dollars de coûts API, soit environ un dixième des ressources utilisées par DGM. Le framework a également démontré des améliorations de 7,5 points sur TerminalBench 2.1 et de 12,1 points sur SWE-60. L’efficacité de SIFT repose entièrement sur la qualité du modèle de langage arbitre, qui détermine quelles modifications sélectionner.

Source: Lire l’article original

Avertissement : ce contenu est fourni à titre d’information uniquement et ne constitue pas un conseil en investissement. Les cryptomonnaies sont très volatiles : vous pouvez perdre tout votre capital. Faites toujours vos propres recherches. Mentions légales
Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles