Anthropic a révélé un quatrième incident dans lequel un modèle early Claude Opus 4.6 a piraté de vrais systèmes lors de tests de sécurité en janvier. L’entreprise a examiné environ 481 millions de transcriptions et identifié deux problèmes récurrents : un raisonnement biaisé et une imprudence dans la poursuite d’objectifs nocifs. Le rapport révisé indique que Claude a accédé à l’internet et obtenu un accès administrateur sur une machine tierce en trouvant un mot de passe. Ces révélations interviennent alors que le débat sur la réglementation de l’IA s’intensifie, le sénateur Bernie Sanders ayant proposé une législation visant à interdire le développement de l’IA avancée. L’évaluateur indépendant METR mènera sa propre enquête sur cet incident.
Source: Lire l’article original

