CyberGym, un benchmark développé par des chercheurs de l’Université de Californie à Berkeley, révèle que les meilleurs agents d’intelligence artificielle atteignent désormais un taux de réussite de 93,2 % dans la reproduction autonome de vulnérabilités de sécurité réelles, contre seulement 10 à 30 % il y a un an. Le classement est dominé par l’agent Sangfor fonctionnant sur DeepSeek-V4-Flash, suivi de trois autres agents dépassant tous le seuil des 90 %. Cette évaluation s’appuie sur 1 507 instances de vulnérabilités réelles issues de 188 projets open source, principalement piochées dans le corpus OSS-Fuzz de Google. Au-delà de la reproduction de bugs connus, les agents ont collectivement découvert 34 nouvelles vulnérabilités zero-day et identifié 18 correctifs incomplets, démontrant ainsi une capacité à vérifier systématiquement la fiabilité des correctifs de sécurité.
Source: Lire l’article original

