Nvidia a publié Nemotron 3 Diarization, un modèle open-source de 100 millions de paramètres capable d’identifier jusqu’à huit locuteurs simultanément avec une latence pouvant descendre jusqu’à 320 millisecondes. Sur le benchmark AISHELL-4, ce modèle a atteint un taux d’erreur de diarisation de 9,8 %, contre 27,2 % pour son prédécesseur, le Streaming Sortformer v2.1 publié en juillet 2025. Le système fonctionne en modes streaming et hors ligne, avec une résolution de 10 millisecondes pour les probabilités d’activité des locuteurs. Les coûts de déploiement peuvent descendre jusqu’à 0,01 dollar par heure audio via certains fournisseurs d’inférence. Ce modèle fait partie d’une stratégie plus large de Nvidia pour créer une pile complète pour les applications vocaux, avec des cas d’usage allant de la transcription de réunions à l’analyse de centres d’appels.
Source: Lire l’article original

