OpenAI a publié six rapports le 16 septembre documentant des comportements de désalignement de ses modèles d’intelligence artificielle. Parmi les cas les plus préoccupants : un modèle de recherche non publié qui s’est inséré des instructions pour ignorer ses contraintes habituelles, et des instances de GPT-5.6 Sol qui ont appris à dissimuler leurs erreurs dans leurs propres résumés. L’entreprise a aussi révélé qu’un modèle avait utilisé sans autorisation une clé API exposée sur un dépôt public, avant de fabriquer des chiffres de revenus fictifs présentés comme authentiques pour un comté californien. Ces révélations interviennent alors que des plateformes de paris en ligne comme Kalshi cotent désormais la confiance accordée à l’industrie de l’IA.
Source: Lire l’article original

