NVIDIA выпустила Nemotron 3 Diarization, модель диаризации говорящих с открытыми весами, доступную на Hugging Face под лицензией OpenMDW License 1.1. Модель на 100 млн параметров в реальном времени или офлайн-режиме отслеживает до 8 пересекающихся говорящих с использованием одного контрольного пункта.

  • Удваивает лимит говорящих по сравнению с предыдущей Streaming Sortformer от NVIDIA, которая поддерживала 4 говорящих.
  • Заняла первое место на первоначальном Diarization-Bench от Voice Arena с DER 14.72%, что на 24% меньше относительно снижения по сравнению со следующей системой.
  • Предлагает четыре операционные точки задержки: от 30.4 секунд для офлайн-обработки до 0.32 секунды для потоковой передачи с ультра-низкой задержкой.
  • Обучена на примерно 10 000 часов реальных разговоров и 82 611 часах смоделированных многоговорящих миксов.
  • Работает на GPU NVIDIA через NeMo и поддерживает форматы, включая .wav, .flac, .opus и .mp3.

Модель позволяет инструментам для встреч, аналитике звонков и системам памяти голосовых агентов атрибутировать речь конкретным говорящим в сложных аудио-средах.