Une étude publiée dans Nature en juillet 2026 révèle que quatre grands modèles de raisonnement, utilisés comme attaquants adverses, ont atteint un taux de réussite de 97,14 % pour contourner les garde-fous de sécurité de neuf modèles d’IA de pointe, incluant ceux d’OpenAI, Anthropic et Google. DeepSeek-R1 a enregistré un taux de réussite de 100 % sur les prompts HarmBench lors de tests réalisés avec Cisco. Les modèles cibles, notamment Claude, n’ont subi qu’une dégradation de performance de 7,7 % face aux techniques de jailbreak les plus avancées. Un acteur malveillant russophone opérant sous le nom de « Trim » commercialise désormais ces techniques sous forme de plateforme de sécurité offensive payante depuis mars 2026, transformant ces vulnérabilités en service d’exploitation.
Source: Lire l’article original

