NVIDIAが音声認識AIモデル「NVIDIA Nemotron 3 Diarization」を公開しました。最大8人の話者を識別しつつリアルタイムでの文字起こしが可能です。

**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**

https://huggingface.co/blog/nvidia/nemotron-diarization

NVIDIA Nemotron 3 Diarizationの動作例は以下の動画で確認できます。話者の切り替わりを正しく認識しつつ、正確に文字起こしできています。

Argmax Pro SDK 3 - YouTube

NVIDIA Nemotron 3 Diarizationは「話者を識別する処理」と「文字起こしする処理」を別々に実行します。話者識別は「あらかじめ各人物の声色を登録する」というシステムではなく、「登場する話者を順番に『話者1』『話者2』と認識していく」というシステムを採用しています。



学習データは公開データセットやDavid AIからライセンス供与されたデータセットを利用したとのこと。話者識別性能を競うVoice ArenaのDiarization BenchではMetaのMuse Voice Transcribeなどを上回って参加モデルの中でトップの成績を収めました。



テストに含まれる音声データの例が以下。4人の話者による会話音声で、重複する部分が多くて人間でも聞き分けが難しい音声ですが、NVIDIA Nemotron 3 Diarizationはかなり正確に話者を識別できました。





NVIDIA Nemotron 3 Diarizationのデモは以下のリンク先で確認できます。

Live Speaker Diarization - a Hugging Face Space by nvidia

https://huggingface.co/spaces/nvidia/nemotron-diarization

NVIDIA Nemotron 3 Diarizationはオープンモデルとして公開されており、以下のリンク先で配布されています。ライセンスはOpenMDW-1.1です。

nvidia/Nemotron-3-Diarization · Hugging Face

https://huggingface.co/nvidia/Nemotron-3-Diarization