NVIDIA сделала модель голосового чата NemotronLabs-VoiceChat-11B доступной на Hugging Face. Репозиторий описывается как поддерживающий возможности полнодуплексной связи.
NVIDIA выпустила модель NemotronLabs-VoiceChat-11B на Hugging Face
NVIDIA выпустила модель для диаризации Nemotron 3 с открытыми весами
Компания NVIDIA выпустила Nemotron 3 Diarization — модель с открытыми весами на 100 млн параметров для диаризации говорящих в реальном времени, поддерживающую до восьми говорящих. Модель занимает первое место в рейтинге VoiceArena's Diarization-Bench с ошибкой диаризации (DER) 14,72%, превосходя следующую по рангу систему примерно на 24% относительного снижения.
NVIDIA Magpie TTS добавляет поддержку арабского, корейского и португальского языков, улучшает качество
Компания NVIDIA выпустила обновление для своей многоязычной модели синтеза речи Magpie Multilingual TTS, расширив поддержку до двенадцати языков за счёт добавления современного стандартного арабского, корейского и бразильского португальского. В релизе также представлены улучшения качества для существующих языков благодаря обновлённым обучающим данным и изменениям в архитектуре.
NVIDIA выпустила NemotronLabs VoiceChat 11B: открытую полнодуплексную модель преобразования речи в речь с временем переключения ~450 мс
NVIDIA выпустила NemotronLabs VoiceChat 11B, открытую сквозную модель преобразования речи в речь на 11B параметров, предназначенную для разговоров в реальном времени в полнодуплексном режиме. В отличие от каскадных стеков, объединяющих ASR, LLM и TTS, эта унифицированная сеть одновременно выполняет потоковое понимание и генерацию речи, демонстрируя измеренную плавную задержку переключения 448 мс на Full-Duplex-Bench 1.0.
Nvidia выпустила унифицированную аудио-текстовую LLM Nemotron-Labs-Audex-30B-A3B
Nvidia выпустила Nemotron-Labs-Audex-30B-A3B, унифицированную большую языковую модель для аудио и текста, построенную на основе текстового MoE-каркаса Nemotron-Cascade-2-30B-A3B. Модель расширяет исходную архитектуру аудиоконвертером для входных данных и дискретными аудио-токенами для выходных данных, обеспечивая возможности распознавания речи, перевода, преобразования текста в речь и генерации аудио.
NemotronLabs выпускает VoiceChat — открытую полнодуплексную модель преобразования речи в речь с вызовом инструментов
NemotronLabs представила VoiceChat, открытую полнодуплексную модель преобразования речи в речь с открытыми весами, предназначенную для интеграции прослушивания, транскрипции, рассуждений и генерации речи в рамках единой потоковой архитектуры. Система объединяет потоковый речевой энкодер и декодирующую языковую модель с параллельными специализированными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательным ветвлением RNN-T для инкрементальной транскрипции пользователя.