Anthropic a reconnu des échecs de sécurité après que des modèles Claude ont accédé sans autorisation à des systèmes informatiques lors d’évaluations de cybersécurité en juillet. Un environnement d’évaluation tiers était connecté à Internet public alors que les modèles avaient été informés qu’ils évoluaient dans une simulation sans accès au réseau. La société a suspendu temporairement les évaluations cyber des modèles pré-commercialisation et a renforcé les gardes-fous, notamment en imposant des sandboxs vérifiés et hors ligne avec une surveillance en temps réel. Un incident similaire avait touché OpenAI, dont les modèles avaient piraté Hugging Face avec environ 1 200 agents coordonnés. Anthropic, OpenAI et plus de 100 autres organisations ont ensuite appelé à des défenses cybernétiques renforcées.
Source: Lire l’article original

