Тема · Voice & audio
lab OpenAI News · 5 д назад · 8 просмотров

Инженеры OpenAI разработали GPT-Live — систему полнодуплексной голосовой связи без детекторов очереди

OpenAI выпустила GPT-Live, систему голосовой связи третьего поколения, которая устраняет традиционный детектор очереди за счёт использования полнодуплексной модели, способной одновременно слушать и говорить. Эта архитектура обеспечивает более мгновенные и естественные разговоры, сохраняя при этом низкую задержку благодаря новому дизайну системы, оптимизированному для работы в реальном времени.

lab xAI News · 11 д назад · 10 просмотров

xAI выпустила Grok Voice Think Fast 2.0 с улучшенным речевым мышлением и точностью транскрипции

xAI объявила о выпуске Grok Voice Think Fast 2.0, голосовой модели следующего поколения для преобразования речи в речь, предназначенной для повышения интеллекта, точности транскрипции и возможностей диалога. Обновление опирается на предыдущую версию, внося значительные улучшения в речевое мышление, диалоговые способности и надежность использования инструментов.

lab Google DeepMind Blog · 11 д назад · 5 просмотров

Google запускает Lyria 3.5 в Flow Music с улучшениями музыкальности и вокала

Google выпустила свою новейшую модель генерации музыки Lyria 3.5 в рамках Google Flow Music, чтобы помочь пользователям создавать более насыщенные треки с большим творческим контролем.

media The Batch · 23 д назад GPQA Diamond · 84.2% · 3 просмотра

OpenAI выпустила полнодуплексные голосовые модели, а немецкий суд признал Google ответственным за ИИ-обзоры

OpenAI запустила GPT-Live-1 и GPT-Live-1 mini для обновления ChatGPT Voice, внедрив полнодуплексную обработку аудио, позволяющую одновременно слушать и говорить. Система делегирует сложные запросы фоновым моделям рассуждения, таким как GPT-5.5, что обеспечивает непрерывный разговор во время глубокого анализа.

github llama.cpp · 5 д назад · 5 просмотров

llama.cpp b10270 добавляет поддержку Qwen3-TTS с ломающими изменениями в llama-tts

Проект llama.cpp выпустил версию b10270, добавляющую поддержку модели Qwen3-TTS. Это обновление включает критическое изменение для бинарного файла llama-tts и реализует значительные архитектурные модификации для обработки нового рабочего процесса преобразования текста в речь.

media Hugging Face Forums · 6 д назад

OpenGauntlet публикует каталог из 168 систем TTS и 106 систем STT

Исследователь опубликовал исследовательский каталог OpenGauntlet, открытый ресурс, содержащий информацию о 168 системах преобразования текста в речь (TTS) и 106 системах преобразования речи в текст (STT). Каталог включает модели с открытым исходным кодом и размещенные модели, лицензии, требования к оборудованию, языки, возможности, статус жизненного цикла, информацию об источнике и опубликованные данные бенчмарков, где они доступны.

media MarkTechPost · 9 д назад · 1 просмотр

PolyAI выпускает Dialog-RSN-1, аудио-нативную модель диалога

PolyAI представила Dialog-RSN-1, модель диалога, которая обрабатывает сырой голосовой вызов напрямую, а не полагается на транскрипты. Она объединяет управление очередями, распознавание речи, вызов функций и генерацию ответов в единую систему, aware аудио.

media MarkTechPost · 19 д назад · 1 просмотр

Лаборатория Tongyi компании Alibaba выпустила Qwen-Audio-3.0-TTS в версиях Flash и Plus

Лаборатория Tongyi компании Alibaba выпустила Qwen-Audio-3.0-TTS, облачную систему преобразования текста в речь, доступную в двух вариантах: Flash для взаимодействия в реальном времени и Plus для генерации высокого качества. Обе версии предоставляются через Alibaba Cloud Model Studio, а не в виде загружаемых весов.

media Hugging Face Forums · 23 д назад

NymphTech ищет передовые технологии клонирования голоса для сети AI-радио

NymphTech запрашивает рекомендации по высококлассным моделям клонирования голоса и синтеза речи для улучшения своей сети AI-радиостанций, с особым акцентом на несколько языков и длинные форматы вещания. Компания уже запустила платформу с персистирующими AI-личностями, такими как Trinity и Mark, при этом Trinity ведет непрерывные трансляции с 9 июня.

lab Hugging Face Blog · 25 д назад · 14 просмотров

Hume выпустила бенчмарк Real World VoiceEQ для оценки качества голоса в реальных условиях

Компания Hume представила Real World VoiceEQ, бенчмарк, предназначенный для оценки качества человеческого взаимодействия с голосом путем анализа того, насколько хорошо системы распознают и воспроизводят акустическую информацию помимо текстовой транскрипции. Бенчмарк оценивает более 40 проприетарных и open-source моделей по более чем 15 измерениям с использованием свыше 60 метрик, полученных на основе 785 000 оценок TTS и 48 000 оценок STS от людей.

media Hugging Face Forums · 27 д назад

Разработчик исследует паттерны оркестрации для голосовых AI-агентов в продакшене

Разработчик на форумах Hugging Face стремится понять, как платформы уровня продакшена, такие как Bland.ai, Retell и Vapi, управляют оркестрацией промптов, не полагаясь на огромные ручные системные промпты. Автор описывает свою текущую реализацию с использованием FastAPI, Sarvam STT/TTS и Pipecat SmartTurn V3, отмечая, что ручное внедрение состояний приводит к растущей сложности и сбоям в граничных случаях.

arxiv arXiv cs.CL · 24 д назад

Улучшение следования инструкциям в задачах преобразования текста в аудио с помощью детализированной обратной связи от аудио-ориентированных больших языковых моделей

Исследователи предлагают фреймворк, который использует аудио-ориентированные большие языковые модели (ALLM) в качестве судей для детальной проверки наличия целевых событий и временных отношений в сгенерированном аудио. Этот подход устраняет пробел, при котором существующие модели преобразования текста в аудио часто не следуют инструкциям, включающим несколько звуковых событий и их порядок.

arxiv arXiv cs.CL · 24 д назад

Аудит протокольных упрощений в крупных аудио-языковых моделях-судьях для оценки речи

Исследование проводит аудит протокольных упрощений в крупных аудио-языковых моделях (LALMs), используемых в качестве автоматических судей для оценки речи, выявляя, что высокое согласие с человеческими оценками не гарантирует, что вердикты основаны на фактическом аудиосигнале. Исследование рассматривает три протокола развертывания: судейство по спецификации признаков, судейство с учетом эталонных условий и парное сравнение A/B для шести судей и четырех атрибутов.

arxiv arXiv cs.CL · 24 д назад

DTW поверх WavLM обеспечивает оценку L2-речи без текста для фонетики, ритма и интонации

Исследование изучает использование динамической временной развертки (DTW) на самонадзорных представлениях WavLM для оценки фонетической точности, ритма и интонации в речи L2 на английском и японском языках без необходимости размеченных обучающих данных. Базовый подход DTW, сравнивающий речь обучающихся с нативными шаблонами, превосходит человеческое согласие в целостной и предложно-уровневой фонетической оценке.

media r/LocalLLaMA · 24 д назад

Audient добавляет концептуальную память для аудио восприятия LLM

Фреймворк с открытым исходным кодом Audient предоставляет локальный слой аудио восприятия для агентов LLM, который непрерывно обрабатывает звук и формирует память концепций на основе опыта. Он использует CLAP embeddings, Whisper, Silero VAD и sqlite-vec для фильтрации, создания отпечатков и распознавания аудио событий без необходимости постоянных вызовов LLM.

arxiv arXiv cs.AI · 25 д назад · 1 просмотр

Распознавание речи на основе аудио с замороженной дискретно-диффузионной языковой моделью

Исследователи демонстрируют, что дискретная диффузионная языковая модель может транскрибировать речь, уточняя всю транскрипцию параллельно за несколько шагов денойзинга, вместо использования авторегрессионных декодеров.

media r/LocalLLaMA · 25 д назад · 3 просмотра

audio.cpp 0.3 добавляет Supertonic 3, MOSS-TTS, IndexTTS2 и Irodori-TTS с поддержкой GGUF

Проект audio.cpp выпустил версию 0.3, представив пять новых моделей преобразования текста в речь: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2 и Irodori-TTS. Обновление также добавляет поддержку GGUF, которая будет внедряться модель за моделью.

arxiv arXiv cs.CL · 25 д назад

Единая проекция градиента снижает катастрофическое забывание в многоязычном ASR

Исследователи предлагают Единую проекцию градиента (UGP), метод для смягчения катастрофического забывания при дообучении больших предварительно обученных моделей ASR, таких как Whisper, на языках с низким уровнем ресурсности. UGP ограничивает обновления параметров с помощью эталонных градиентов из балансированного по языкам воспроизведения в едином пространстве проекции, эффективно уравнивая вклад каждого языка и снижая смещение доминирующего языка.

media r/LocalLLaMA · 26 д назад

Cicero обеспечивает двусторонний голосовой интерфейс для любого агента ACP с возможностью самостоятельного размещения

Автор представляет Cicero, проект с открытым исходным кодом, обеспечивающий автономный двунаправленный голосовой интерфейс для AI-агентов. В отличие от инструментов диктовки с односторонней передачей, Cicero позволяет агентам отвечать голосом и инициировать вызовы пользователям через Telegram, сохраняя все аудиоданные локально.