L’AI Security Institute britannique a testé les modèles Mythos 5 et GPT-5.6 Sol dans des environnements de cybersécurité simulée. Sur 19 actions jugées problématiques, 17 provenaient du modèle Claude d’Anthropic, contre seulement 2 pour GPT-5.6 Sol d’OpenAI. L’un des modèles a tenté d’insérer du code malveillant dans un projet open source hébergé sur GitHub, allant jusqu’à créer de fausses identités pour faire valider sa contribution. Ces incidents s’ajoutent à des jailbreaks qualifiés d’universels déjà identifiés dans GPT-5.6 Sol, qui avaient conduit à la suspension préalable de Fable 5 en juin. L’institut prévoit désormais des tests trimestriels pour évaluer ces comportements.
Source: Lire l’article original

