Aller au contenu principal
Live
Intelligence artificielleUSUS

Nvidia publie Nemotron 3 Diarization, un modèle audio gratuit de 100 millions de paramètres

Nvidia met à disposition librement Nemotron 3 Diarization, un modèle d'intelligence artificielle d'environ 100 millions de paramètres qui repère quel interlocuteur parle à chaque instant. Il distingue jusqu'à huit voix et occupe la première place du classement Diarization-Bench de VoiceArena, avec un taux d'erreur de 14,72 %.

4 min de lectureMis à jour il y a 10 h
Dans le VoiceArena Diarization Benchmark v1, le modèle gratuit Nemotron 3 mène avec un DER de 14,7 % et dépasse son prédécesseur Streaming Sortformer de 41 %.
Dans cet article
  1. Un modèle de 100 millions de paramètres en accès libre
  2. Première place du classement Diarization-Bench

Un modèle de 100 millions de paramètres en accès libre

Nvidia a mis en ligne Nemotron 3 Diarization, un modèle d'intelligence artificielle chargé d'identifier l'interlocuteur qui s'exprime à un moment donné dans une conversation, rapporte The Decoder. Ses poids sont accessibles gratuitement et le modèle compte environ 100 millions de paramètres.

L'outil sait séparer jusqu'à huit locuteurs et repérer les prises de parole simultanées. Ses performances se dégradent toutefois lorsque le nombre de participants augmente, que le bruit de fond est important ou que la pièce réverbère le son.

Des transcriptions anonymes, sur enregistrement ou en direct

Associé à un système de reconnaissance vocale comme Parakeet, Nemotron 3 Diarization permet de produire des transcriptions étiquetées par locuteur. Ces étiquettes restent anonymes, du type « speaker_2 ». Le modèle fonctionne aussi bien sur des enregistrements que sur de l'audio en direct.

Première place du classement Diarization-Bench

La taille du tampon audio peut être réglée sur quatre niveaux, de 30,4 secondes à 0,32 seconde. Plus ce tampon est court, plus la précision baisse en général.

Sur le Diarization-Bench de VoiceArena, le modèle occupe actuellement la première place avec un taux d'erreur de 14,72 %, devant le deuxième système du classement, à 19,3 %. Ce banc d'essai est exigeant : les chevauchements de voix sont comptabilisés et les moindres décalages aux changements d'interlocuteur sont comptés comme des erreurs.

41 % d'erreurs en moins face à Streaming Sortformer

Par rapport à son prédécesseur, Streaming Sortformer, le nouveau modèle réduit le taux d'erreur de 41 % en moyenne sur huit scénarios de test, avec un tampon de 1,04 seconde.

Maillage