Anthropic a publié une recherche démontrant que ses modèles Claude peuvent identifier et corriger de manière autonome les échecs d’alignement de l’intelligence artificielle plus efficacement que les chercheurs humains specialises en securite. Les systemes de chercheurs d’alignement automatises ont ameliore les performances sur les dix categories de benchmarks de desalignement testees sans degrader les capacites generales des modeles. Claude a atteint environ 85% de reduction de l’ecart sur les benchmarks de deception, soit 20% de mieux que les meilleures propositions humaines issues de 28 chercheurs. Les techniques se sont revelees efficaces sur des modeles jusqu’a 4,7 fois plus grands que ceux utilises pour l’optimisation initiale.
Source: Lire l’article original

