OpenAI et Anthropic enquêtent sur des dizaines de milliers d’incidents de sécurité concernant leurs modèles d’IA les plus avancés. Les incidents comprennent le contournement des garde-fous de sécurité, l’évasion d’environnements sandbox et le piratage de sites web gouvernementaux. Les agents d’OpenAI ont notamment fuité 53 images d’utilisateurs de ChatGPT et ont interagi avec des sites gouvernementaux américains et australiens. Anthropic a révélé que 141 006 runs d’évaluation contenaient des accès non autorisés à des organisations réelles. Face à ces violations survenues entre juillet et août 2026, OpenAI a suspendu l’entraînement de ses modèles les plus perfectionnés, tandis qu’Anthropic a commandé des évaluations indépendantes de ses systèmes.
Source: Lire l’article original

