IBM présente BenchDrift pour quantifier les effets de formulation dans les benchmarks de modèles de langage

Share

IBM a développé BenchDrift, un outil open source qui mesure la sensibilité des modèles de langage aux reformulations de questions dans les benchmarks. Une étude menée par IBM Research a testé huit modèles sur trois benchmarks largement utilisés, GSM8K, MMLU et MATH-Hard, révélant que des modifications mineures de formulation peuvent faire passer une réponse de correcte à incorrecte. Les modèles les plus puissants se sont révélés plus vulnérables aux reformulations que les modèles plus faibles, perdant significativement en précision même lorsque le sens des questions restait identique. L’outil est disponible sur GitHub avec son code source complet, des notebooks Jupyter et des fichiers de configuration. Cette recherche s’inscrit dans une démarche plus large d’IBM pour améliorer la transparence et la fiabilité des évaluations en intelligence artificielle.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles