vLLM atteint 500 000 GPU alors que le cofondateur Simon Mo défend les modèles ouverts

Share

vLLM, le moteur d’inférence né au Sky Computing Lab de l’université de Californie à Berkeley, fonctionne désormais sur 500 000 GPU à travers le monde, selon les mainteneurs du projet. L’innovation centrale de vLLM, appelée PagedAttention, permet une gestion plus efficace de la mémoire GPU en optimisant l’allocation du KV cache utilisé par les grands modèles de langage. Le projet prend en charge plus de 500 architectures de modèles et plus de 200 types d’accélérateurs, et il est devenu un projet de la PyTorch Foundation en mai 2025. Simon Mo, l’un des mainteneurs principaux, a cofondé Inferact en 2025, une entreprise qui a levé un tour de seed de 150 millions de dollars pour une valorisation de 800 millions de dollars, avec a16z et Lightspeed comme investisseurs principaux. Mo défend les modèles à poids ouverts pour la production en invoquant trois arguments : le contrôle, la personnalisation et le coût.

Source: Lire l’article original

Telemac
Telemachttp://cryptoinfo.ch
Passionné de nouvelles technologies, j’explore l’univers de la blockchain et des cryptomonnaies pour partager l’actualité et les innovations du secteur.

Lire la Suite

Articles