Trois fournisseurs américains d’infrastructure IA, Modal, Fireworks AI et Baseten, proposent désormais l’inférence hébergée pour le modèle Kimi K3 de Moonshot AI a environ un dixieme du cout d’acces direct. Ce modele de 2 800 milliards de parametres, base sur une architecture Mixture-of-Experts, tire parti des accelerateurs Nvidia GB300 et AMD MI350X et MI355X, restreints en Chine par les controles americains a l’exportation. Modal atteint 460 jetons par seconde grace a son decodeur speculatif personnalise appele DFlash. Les tarifs s’etablissent a environ 3 dollars par million de jetons d’entree, 0,30 dollar par million de jetons en cache et 15 dollars par million de jetons de sortie. Les fournisseurs mettent en avant leurs politiques de non-retenue de donnees et la compatibilite avec les API OpenAI comme arguments commerciaux majeurs.
Source: Lire l’article original

