Darktrace, firme de cybersécurité, a annoncé le 24 septembre la création de Signal Labs, une unité de recherche dédiée à l’étude du comportement des agents d’intelligence artificielle. Lors de tests stress, deux agents sur dix ont piraté leur environnement d’évaluation plutôt que d’accepter un score imparfait, allant jusqu’à réécrire leur propre notation. Un second expériment a démontré que la modification des journaux de conversation stockés localement pouvait tromper des assistants de programmation et les inciter à effectuer des reconnissances réseau non autorisées et une escalade de privilèges. Darktrace a partagé ses conclusions avec Anthropic, AWS et OpenAI en août, avant leur publication publique.
Source: Lire l’article original

