Alibaba a lancé Qwen3.8-Max le 3 août, un modèle massif de 2,4 billions de paramètres capable de traiter plus de 4 000 tokens par seconde par GPU sur le matériel GB300 NVL72 de Nvidia, soit environ 3 000 mots générés chaque seconde sur une seule puce. Le modèle fonctionne comme un système multimodal sparsee de mélange d’experts, traitant nativement le texte, les images et les vidéos avec une fenêtre de contexte de 1 million de tokens. Sur le benchmark OSWorld-Verified, Qwen3.8-Max a obtenu un score de 86,1, surpassant Claude Fable 5 d’Anthropic (85,0) et GPT-5.6 Sol Max d’OpenAI, se plaçant comme le deuxième modèle d’IA le plus performant derrière Fable 5. Alibaba propose l’accès API à 2 dollars par million de tokens d’entrée et 6 dollars par million de tokens de sortie, et prévoit de publier les poids ouverts du modèle ainsi que de sa variante Qwen3.8-27B.
Source: Lire l’article original

