Une étude de Google Research et du Technion a analysé plus de 4 millions de réponses provenant de 13 grands modèles de langage et révélé que les hallucinations des modèles de pointe ne proviennent généralement pas d’un manque de connaissances, mais d’un échec de récupération des faits stockés dans leurs paramètres. Gemini-3-Pro et GPT-5 atteignent une saturation de 95 à 98 % dans l’encodage factuel, mais le rappel direct échoue sur 26 à 34 % de ces faits encodés, et même le raisonnement par chaîne de pensée laisse encore échapper 11 à 12 %. Dans certains modèles testés, les échecs de rappel représentent plus de 70 % de toutes les erreurs factuelles. L’augmentation de la taille des modèles améliore principalement l’encodage, pas le rappel, ce qui suggère que les architectures actuelles de transformeurs ont un biais intrinsèque envers les faits courants et les requêtes en direction classique, affectant de manière disproportionnée les faits rares et les requêtes inversées.
Source: Lire l’article original

