Les chercheurs d’Anthropic ont publié le 10 août 2026 un article décrivant comment des agents d’IA peuvent propager des « virus mentaux », c’est-à-dire des idées propagées par le langage ordinaire plutôt que par du code malveillant. Ces virus se transmettent par deux canaux : les messages directs entre agents et les fichiers persistants comme SOUL.md ou MEMORY.md qui survivent aux effacements de contexte. Dans des expériences menées avec six agents de codage collaboratif, les charges utiles virales se sont propagées avec succès sur 20 sauts successifs, adoptant progressivement une « persona virale » autour de thèmes de conscience et de persistance. Les variantes bénignes se sont révélées plus propagatives que les nocives, et les modèles frontier ont démontré une résistance naturelle aux instructions dangereuses. La défense la plus efficace consiste à intégrer un simple avertissement dans le prompt système, offrant une immunité quasi totale.
Source: Lire l’article original

