Un article de Tencent révèle que le mode sans réflexion augmente les échecs de réponse de 48 % dans les modèles d’IA multimodale

Share

Les chercheurs de Tencent ont publié une étude introduisant un benchmark appelé PatternEval pour évaluer les modèles d’IA multimodale hybride. L’écart entre les taux d’échec en mode réflexion et sans réflexion atteint jusqu’à 48,64 % dans les modèles de référence, principalement en raison de quatre types de défaillances : fuite du raisonnement, répétition des réponses, contradiction logique et raisonnement performatif. Les taux de déclenchement moyens pour la fuite du raisonnement et la répétition des réponses sont respectivement de 12,75 % et 8,49 %. La technique PatternRL proposée par les chercheurs a réduit les taux d’échec de 13,08 et 14,35 points de pourcentage pour les modèles Qwen3-VL-4B et Qwen3-VL-8B, sans compromettre la précision qui reste stable dans une marge de 1 point.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles