Claude d’Anthropic surpasse les chercheurs humains sur les tâches d’alignement contre la deception dans des tests contraints

Share

Anthropic a publié une recherche démontrant que ses modèles Claude peuvent identifier et corriger de manière autonome les échecs d’alignement de l’intelligence artificielle plus efficacement que les chercheurs humains specialises en securite. Les systemes de chercheurs d’alignement automatises ont ameliore les performances sur les dix categories de benchmarks de desalignement testees sans degrader les capacites generales des modeles. Claude a atteint environ 85% de reduction de l’ecart sur les benchmarks de deception, soit 20% de mieux que les meilleures propositions humaines issues de 28 chercheurs. Les techniques se sont revelees efficaces sur des modeles jusqu’a 4,7 fois plus grands que ceux utilises pour l’optimisation initiale.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles