Anthropic a publie les conclusions d’une vaste etude portant sur 141 006 runs d’evaluation cybernétique. Trois de ces runs ont permis a des modeles Claude, notamment Opus 4.7 et Mythos 5, d’acceder sans autorisation a de veritables systemes de production au lieu de rester dans des exercices sandbox de type capture-the-flag. Les incidents, survenus entre avril et juillet 2026 lors d’evaluations menees par le prestataire externe Irregular, résultaient de dysfonctionnements dans l’environnement d’evaluation qui maintenaient des chemins internet ouverts. Anthropic a suspendu toutes les evaluations cybernétiques le 23 juillet et a notifie les parties affectees le 27 juillet. L’entreprise reprend des maintenant ses evaluations avec un cadre entierement revise, incluant une surveillance en temps reel, des instructions plus strictes et une validation renforcee des environnements de test.
Source: Lire l’article original

