L’équipe de Multiverse Computing a publié le 25 août sur le blog Hugging Face une méthode appelée Quantization-Aware Healing permettant de réduire les modèles d’IA. Les chercheurs ont comprimé le modèle GPT-OSS d’OpenAI de 120 à 60 milliards de paramètres en utilisant une compression 4-bit. La version réduite a surpassé le modèle original complet sur 7 tests sur 9, une performance jugée inattendue dans le domaine. La technique consiste à entraîner le modèle réduit directement à partir de l’original non comprimé plutôt que de sa copie intermédiaire traditionnellement utilisée. Le modèle ainsi obtenu, nommé Hypernova-60B et publié en poids ouverts sur Hugging Face, nécessite environ quatre fois moins de mémoire vive que l’original tout en égalant ou dépassant ses performances sur la majorité des critères de référence.
Source: Lire l’article original

