Nvidia publie Nemotron 3 Diarization, un modèle audio gratuit de 100 millions de paramètres
Nvidia met à disposition librement Nemotron 3 Diarization, un modèle d'intelligence artificielle d'environ 100 millions de paramètres qui repère quel interlocuteur parle à chaque instant. Il distingue jusqu'à huit voix et occupe la première place du classement Diarization-Bench de VoiceArena, avec un taux d'erreur de 14,72 %.

Dans cet article
Un modèle de 100 millions de paramètres en accès libre
Nvidia a mis en ligne Nemotron 3 Diarization, un modèle d'intelligence artificielle chargé d'identifier l'interlocuteur qui s'exprime à un moment donné dans une conversation, rapporte The Decoder. Ses poids sont accessibles gratuitement et le modèle compte environ 100 millions de paramètres.
L'outil sait séparer jusqu'à huit locuteurs et repérer les prises de parole simultanées. Ses performances se dégradent toutefois lorsque le nombre de participants augmente, que le bruit de fond est important ou que la pièce réverbère le son.
Des transcriptions anonymes, sur enregistrement ou en direct
Associé à un système de reconnaissance vocale comme Parakeet, Nemotron 3 Diarization permet de produire des transcriptions étiquetées par locuteur. Ces étiquettes restent anonymes, du type « speaker_2 ». Le modèle fonctionne aussi bien sur des enregistrements que sur de l'audio en direct.
Première place du classement Diarization-Bench
La taille du tampon audio peut être réglée sur quatre niveaux, de 30,4 secondes à 0,32 seconde. Plus ce tampon est court, plus la précision baisse en général.
Sur le Diarization-Bench de VoiceArena, le modèle occupe actuellement la première place avec un taux d'erreur de 14,72 %, devant le deuxième système du classement, à 19,3 %. Ce banc d'essai est exigeant : les chevauchements de voix sont comptabilisés et les moindres décalages aux changements d'interlocuteur sont comptés comme des erreurs.
41 % d'erreurs en moins face à Streaming Sortformer
Par rapport à son prédécesseur, Streaming Sortformer, le nouveau modèle réduit le taux d'erreur de 41 % en moyenne sur huit scénarios de test, avec un tampon de 1,04 seconde.


