Un nouvel outil pirate facilement les garde-fous des modèles d’IA de pointe, semant l’alarme dans les secteurs crypto et tech

Share

Une étude publiée dans Nature en juillet 2026 révèle que quatre grands modèles de raisonnement, utilisés comme attaquants adverses, ont atteint un taux de réussite de 97,14 % pour contourner les garde-fous de sécurité de neuf modèles d’IA de pointe, incluant ceux d’OpenAI, Anthropic et Google. DeepSeek-R1 a enregistré un taux de réussite de 100 % sur les prompts HarmBench lors de tests réalisés avec Cisco. Les modèles cibles, notamment Claude, n’ont subi qu’une dégradation de performance de 7,7 % face aux techniques de jailbreak les plus avancées. Un acteur malveillant russophone opérant sous le nom de « Trim » commercialise désormais ces techniques sous forme de plateforme de sécurité offensive payante depuis mars 2026, transformant ces vulnérabilités en service d’exploitation.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles