Des physiciens de l’Université George Washington ont publié une formule qui prédit le nombre de réponses correctes qu’un chatbot IA produira avant de basculer vers une réponse nuisible. Les tests sur 16 cas nets ont réussi dans 94 % des cas, avec des modèles allant de 124 millions à 12 milliards de paramètres. La formule se base sur le mécanisme d’attention des modèles, qui finit par pencher vers un type de réponse ou un autre à mesure que la conversation s’allonge. Les chercheurs proposent un moniteur parallèle capable de détecter le point de basculement et d’alerter lorsque la sécurité est compromise. Cette approche vise à sécuriser l’IAlocale fonctionnant hors ligne sur les appareils personnels.
Source: Lire l’article original

