NOVA-VAD, лёгкий и интерпретируемый детектор активности речи, достигает точности 93% при шумном аудио из набора данных UrbanSound8K, превосходя WebRTC (58%), Pyannote (62%) и Silero (87%). Он использует только scikit-learn, не требует GPU и предоставляет важность признаков и оценки уверенности на простом английском языке.
NOVA-VAD побеждает Silero, Pyannote и WebRTC при шумном аудио с точностью 93%
NVIDIA выпустила модель NemotronLabs-VoiceChat-11B на Hugging Face
NVIDIA сделала модель голосового чата NemotronLabs-VoiceChat-11B доступной на Hugging Face. Репозиторий описывается как поддерживающий возможности полнодуплексной связи.
Freya-TTS выпускает модель турецкого синтеза речи без токенизатора с WER 8,0%
Исследователи представляют Freya-TTS, компактную модель преобразования текста в речь без токенизатора, оптимизированную для турецкого языка, которая достигает ошибки распознавания слов (WER) на уровне 8,0% на бенчмарке Freya-TR-Eval. Неразвернутая по времени условная диффузионная трансформерная модель с 183,2 млн параметров, основанная на matched flow, работает в замороженном непрерывном латентном пространстве AudioVAE2, обеспечивая высококачественное восстановление сигнала с частотой 48 кГц без использования фонемизатора или дискретного токенизатора речи.
OpenMOSS выпустила MOSS-Transcribe-Diarize 0.9B для совместной транскрипции и диаризации
OpenMOSS выпустила MOSS-Transcribe-Diarize, модель понимания аудио с 0.9B параметров, предназначенную для длинной многоречевой транскрипции, диаризации, таймстампов и распознавания акустических событий.
Gepard 1.0 открывает исходный код потоковой модели TTS для диалогов в реальном времени
Исследователи открыли исходный код Gepard 1.0, потоковой модели преобразования текста в речь (TTS), предназначенной для разговоров в реальном времени и генерирующей аудио по кадрам по мере поступления текста. Модель построена на базе Qwen3.5 0.8B с использованием Nemo NanoCodec и поддерживает клонирование голоса в режиме zero-shot для английского, испанского, португальского и нидерландского языков.
Nvidia выпустила унифицированную аудио-текстовую LLM Nemotron-Labs-Audex-30B-A3B
Nvidia выпустила Nemotron-Labs-Audex-30B-A3B, унифицированную большую языковую модель для аудио и текста, построенную на основе текстового MoE-каркаса Nemotron-Cascade-2-30B-A3B. Модель расширяет исходную архитектуру аудиоконвертером для входных данных и дискретными аудио-токенами для выходных данных, обеспечивая возможности распознавания речи, перевода, преобразования текста в речь и генерации аудио.