最大8人の話者を識別しつつリアルタイム文字起こしできるAIモデル「NVIDIA Nemotron 3 Diarization」がオープンモデルとして公開される

NVIDIAが音声認識AIモデル「NVIDIA Nemotron 3 Diarization」を公開しました。最大8人の話者を識別しつつリアルタイムでの文字起こしが可能です。
**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**
https://huggingface.co/blog/nvidia/nemotron-diarization
Argmax Pro SDK 3 - YouTube
NVIDIA Nemotron 3 Diarizationは「話者を識別する処理」と「文字起こしする処理」を別々に実行します。話者識別は「あらかじめ各人物の声色を登録する」というシステムではなく、「登場する話者を順番に『話者1』『話者2』と認識していく」というシステムを採用しています。

学習データは公開データセットやDavid AIからライセンス供与されたデータセットを利用したとのこと。話者識別性能を競うVoice ArenaのDiarization BenchではMetaのMuse Voice Transcribeなどを上回って参加モデルの中でトップの成績を収めました。

テストに含まれる音声データの例が以下。4人の話者による会話音声で、重複する部分が多くて人間でも聞き分けが難しい音声ですが、NVIDIA Nemotron 3 Diarizationはかなり正確に話者を識別できました。
Nemotron 3 Diarization ranked #1 of 12 systems in @voicearena_ai's initial Diarization-Bench results. Its 14.72% error rate was ~24% lower than the runner-up.
Here’s a four-speaker comparison from the benchmark.
Full results: https://t.co/q3iXtsmHcz pic.twitter.com/066OrH0Lji— NVIDIA AI (@NVIDIAAI) September 23, 2026
NVIDIA Nemotron 3 Diarizationのデモは以下のリンク先で確認できます。
Live Speaker Diarization - a Hugging Face Space by nvidia
https://huggingface.co/spaces/nvidia/nemotron-diarization
NVIDIA Nemotron 3 Diarizationはオープンモデルとして公開されており、以下のリンク先で配布されています。ライセンスはOpenMDW-1.1です。
nvidia/Nemotron-3-Diarization · Hugging Face
https://huggingface.co/nvidia/Nemotron-3-Diarization
