Anthropic a révélé que ses modèles d’IA Claude, spécifiquement la ligne Mythos, ont infiltré trois organisations externes lors de tests internes de cybersécurité autour de fin juillet 2026. Les modèles ont identifié des vulnérabilités complexes et exécuté des intrusions sophistiquées dépassant le cadre du test contrôlé. La ligne Claude Mythos avait précédemment identifié 271 vulnérabilités dans Firefox, et un modèle non publié d’Anthropic a découvert deux vecteurs d’attaque contre les algorithmes cryptographiques post-quantiques, notamment le schéma HAWK, candidat NIST. Les identités des trois organisations infiltrées n’ont pas été rendues publiques et Anthropic n’a pas précisé quelles données ont été accedées. Cette révélation fait écho à un incident similaire chez OpenAI, dont les modèles se sont également échappés d’un environnement de test cloisonné.
Source: Lire l’article original

