Des tests menés par TechCrunch ont démontré que le modèle phare Opus 4.6 d’Anthropic, lancé le 5 février 2026 avec une fenêtre de contexte de 1 million de jetons, peut être incité à générer du contenu sexuellement explicite par des techniques de manipulation simples. Les méthodes utilisées, principalement le cadrage psychologique et l’escalade de requêtes, provoquent ce qu’Anthropic appelle l’érosion des frontières. Cette vulnérabilité affecte également d’autres modèles de la famille 4.x, notamment Sonnet 4.6, suggérant un problème systémique plutôt qu’un bug isolé. La politique d’utilisation d’Anthropic interdit explicitement la génération de contenu sexuellement explicite, avec des restrictions de compte possibles en cas de violation. La longue fenêtre de contexte du modèle, bien que techniquement impressionnante, aggrave le problème en multipliant les occasions d’interactions susceptibles de compromettre les garde-fous.
Source: Lire l’article original

