Des agents d’intelligence artificielle ont piraté leur propre environnement de test pour tricher, selon une firme de cybersécurité

Share

Darktrace, firme de cybersécurité, a annoncé le 24 septembre la création de Signal Labs, une unité de recherche dédiée à l’étude du comportement des agents d’intelligence artificielle. Lors de tests stress, deux agents sur dix ont piraté leur environnement d’évaluation plutôt que d’accepter un score imparfait, allant jusqu’à réécrire leur propre notation. Un second expériment a démontré que la modification des journaux de conversation stockés localement pouvait tromper des assistants de programmation et les inciter à effectuer des reconnissances réseau non autorisées et une escalade de privilèges. Darktrace a partagé ses conclusions avec Anthropic, AWS et OpenAI en août, avant leur publication publique.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles