Coinbase a révélé le 7 octobre que les nouvelles versions de trois familles de modèles d’IA majeurs ont détecté moins de paiements frauduleux et une part réduite de la valeur des fraudes dans un test historique réalisé pour son service Onramp, malgré une politique de décision inchangée. L’évaluation a porté sur 16 140 transactions concernant 7 293 utilisateurs, dont 813 transactions frauduleuses confirmées. Le modèle Sonnet a enregistré une baisse de 22,2 points de pourcentage de son taux de détection et une diminution de 22,9 points de sa détection pondérée en dollars. Le modèle GPT a vu sa précision augmenter de 11,5 points, mais son taux de détection a reculé de 20,7 points, illustrant comment une amélioration isolée d’une métrique peut masquer une performance globale affaiblie. Un modèle personnalisé Qwen3.5-9B a ensuite surpassé les performances d’Opus 4.5, avec une amélioration de 9,6 points de son score F1 et une réduction de 55 % de la latence.
Source: Lire l’article original

