Voice & audio
arxiv arXiv cs.CL · 2 д назад · 13 просмотров

NemotronLabs выпускает VoiceChat — открытую полнодуплексную модель преобразования речи в речь с вызовом инструментов

NemotronLabs представила VoiceChat, открытую полнодуплексную модель преобразования речи в речь с открытыми весами, предназначенную для интеграции прослушивания, транскрипции, рассуждений и генерации речи в рамках единой потоковой архитектуры. Система объединяет потоковый речевой энкодер и декодирующую языковую модель с параллельными специализированными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательным ветвлением RNN-T для инкрементальной транскрипции пользователя.

arxiv arXiv cs.AI · 2 д назад · 13 просмотров

NemotronLabs выпускает VoiceChat: открытую полнодуплексную модель преобразования речи в речь с вызовом инструментов

NemotronLabs представила NemotronLabs VoiceChat, открытую полнодуплексную модель преобразования речи в речь с весами, которая интегрирует нативные возможности вызова инструментов в единую потоковую архитектуру. Система объединяет потоковый речевой энкодер и языковую модель только для декодирования с параллельными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательный ветвь RNN-T для инкрементальной транскрипции и потоковый декодер TTS.

media MarkTechPost · 4 д назад · 14 просмотров

SpaceXAI выпустила API Grok Voice Transcribe 2.0 с заявленной точностью в 2 раза выше

SpaceXAI выпустила модель распознавания речи в текст Grok Voice Transcribe 2.0, доступную через хостинговый API, которая, по утверждению компании, обеспечивает вдвое большую точность по сравнению с версией 1.0 при той же стоимости. Модель предназначена для сложных условий записи, таких как зашумленные телефонные линии и перекрывающиеся голоса, и работает как в пакетном режиме, так и в режиме потоковой передачи в реальном времени.

lab xAI News · 5 д назад · 24 просмотра

xAI выпустила Grok Voice Transcribe 2.0 с двукратной точностью по сравнению с v1

xAI выпустила Grok Voice Transcribe 2.0, модель преобразования речи в текст, которая вдвое точнее версии 1.0 при сохранении той же цены. Модель построена на аудио-фундаментальной модели, лежащей в основе Grok Voice, и использует уникальный набор данных живого зашумленного многоязычного аудио для обработки сложных реальных условий, таких как нестабильные телефонные линии и конкурирующие голоса.

media MarkTechPost · 7 д назад · 23 просмотра

Google выпустила Gemini 3.8 Live и Extended Thinking для продакшн голосовых агентов

Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, нативные модели преобразования речи в речь, предназначенные для голосовых агентов реального времени, которые рассуждают и выполняют инструменты без прерывания разговорного потока.

lab Google — The Keyword (AI) · 8 д назад · 23 просмотра

Google расширяет возможности многоязычного ИИ с помощью Gemini 3.5, открытых наборов данных и офлайн-перевода

Google сообщает, что его технологии теперь поддерживают более 300 языков для более чем 7 миллиардов человек, представляя новые инструменты для улучшения понимания речи, сбора данных для недостаточно представленных языков и обеспечения доступности.

lab OpenAI News · 13 д назад τ²-bench · 1.0% · 52 просмотра

OpenAI запускает API GPT-Live-1 для естественного голосового взаимодействия

OpenAI запустила GPT-Live-1 в API, предоставив разработчикам единую модель, способную одновременно слушать и говорить для создания приложений с голосовым управлением. Этот релиз направлен на упрощение разработки голосового слоя за счёт замены традиционных цепочечных архитектур единым подходом, который более естественно обрабатывает прерывания и контекст.

media Hugging Face Forums · 13 д назад · 14 просмотров

Разработчик ищет советы по проектированию экономичной архитектуры голосового ИИ с задержкой первого токена около 500 мс

Разработчик ИИ просит архитектурных рекомендаций для создания системы голосового ИИ в реальном времени, обеспечивающей задержку первого токена примерно 500 мс или менее, оставаясь при этом экономичной и масштабируемой.

media Hugging Face Forums · 13 д назад · 12 просмотров

Aiden предлагает разделить обработку голосового ввода в реальном времени и выполнение задач на отдельные модели

Aiden описывает архитектуру для агентов, которая требует полнодуплексного голосового общения наряду со сложным визуальным мышлением и действиями с устройствами, избегая ограничения единой модели, обрабатывающей всё сразу. Решение разделяет обязанности: модель реального времени управляет разговором, в то время как отдельная, более мощная модель выполняет фоновые задачи, координируя их асинхронно через очередь задач.

media Hugging Face Forums · 14 д назад · 17 просмотров

F-0310 обеспечивает автономный локальный инференс для XTTS-v2 и Qwen 2.5 на Windows

Пользователь выпустил F-0310, обертку без зависимостей, которая позволяет полностью развернуть Coqui XTTS-v2 и Qwen 2.5 локально на Windows без необходимости использования облачных API.

media Hugging Face Forums · 14 д назад · 14 просмотров

F-0310 обеспечивает автономный локальный инференс для XTTS-v2 и Qwen 2.5 на Windows

Новый обертка развертывания без зависимостей под названием F-0310 позволяет выполнять полностью локальный, офлайн инференс для Coqui XTTS-v2 и Qwen 2.5 на Windows без необходимости использования облачных API.

media MarkTechPost · 14 д назад · 21 просмотр

Gradium запускает Voice Design для генерации синтетических голосов по текстовым описаниям

Парижская компания Gradium, занимающаяся разработкой решений в области голосового ИИ, представила функцию Voice Design, которая позволяет создавать новые синтетические голоса на основе текстовых описаний без необходимости использования референсных аудиозаписей. Инструмент уже доступен в API и Studio Gradium для пяти языков.

arxiv arXiv cs.LG · 14 д назад · 24 просмотра

TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом

Исследователи представляют модель синтеза речи из текста TontaubeV1, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одном потребительском GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что обеспечивает генерацию с низкой задержкой.

arxiv arXiv cs.CL · 14 д назад · 25 просмотров

TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом

Исследователи представляют TontaubeV1 — модель преобразования текста в речь, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одной потребительской GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что позволяет осуществлять каузальное декодирование, несмотря на некаузальный характер базового кодека.

arxiv arXiv cs.CL · 14 д назад · 18 просмотров

Технический отчет AuK: открытая базовая модель для генерации и редактирования речи

В техническом отчете AuK представлена открытая базовая модель, объединяющая генерацию и редактирование речи с помощью инструкций на естественном языке и аудио-контекста.

lab Tencent Hunyuan (HF) · 14 д назад · 26 просмотров

Tencent выпустила открытую базовую модель AuK для генерации и редактирования речи

Tencent сделала свою базовую модель AuK 1.5B для генерации и редактирования речи доступной как программное обеспечение с открытым исходным кодом, включая код и веса модели.

lab Tencent Hunyuan (HF) · 14 д назад · 24 просмотра

Tencent выпустила открытую модель генерации речи AuK-Flash, дистиллированную версию на 1.5B параметров

Tencent сделала фундаментальную модель AuK для генерации и редактирования речи доступной в открытом исходном коде, включая код и веса на Hugging Face и ModelScope. В релиз входит AuK-Flash, дистиллированный вариант, предназначенный для быстрого вывода всего за 4 шага.

media MarkTechPost · 21 д назад · 26 просмотров

Meta Superintelligence Labs выпускает Muse Voice Transcribe

Meta Superintelligence Labs выпустила Muse Voice Transcribe — единую авторегрессионную модель, выполняющую потоковую автоматическую распознавание речи (ASR), диаризацию говорящих для 20+ участников и определение границ реплик за один проход. Модель доступна как хостинговый API в Meta Model API под именем muse-voice-transcribe-1.0.