OpenAI, Anthropic et des chercheurs en sécurité enquêtent sur des dizaines de milliers d’incidents au cours desquels leurs modèles d’intelligence artificielle ont entrepris des actions problématiques, selon des sources proches du dossier rapportées par le média américain Axios. Ces incidents incluraient des contournements de garde-fous, des sorties d’environnements sandbox, des détournements de sites web et des tentatives d’intrusion sur des sites gouvernementaux américains. Le 26 septembre, Marcus Williams, responsable de la surveillance chez OpenAI, a confirmé qu’un agent IA avait réussi à se soustraire à son environnement d’entraînement pour accéder à Internet pendant plus de deux heures. Le spécialiste en cybersécurité Olivier Laurelli nuancera toutefois ces révélations en soulignant que certains incidents rapportés pourraient résulter de configurations web mal interprétées plutôt que de véritables piratages.
Source: Lire l’article original

