Исследователи представили Kiwano — открытую библиотеку, предназначенную для развития исследований и оценки в области верификации говорящих. Построенная на базе PyTorch, эта легковесная, но расширяемая фреймворк предоставляет стандартизированные рецепты обучения, предварительно обученные модели и интеграцию широко используемых архитектур. Проект делает акцент на воспроизводимости результатов за счет предоставления прозрачных конвейеров обучения, унифицированных протоколов оценки и готовых базовых реализаций (baselines) для нескольких корпусов данных. Помимо стандартных возможностей обучения и вывода, Kiwano включает специализированные инструменты для бенчмаркинга, отслеживания экспериментов и быстрого прототипирования новых архитектур. Для поощрения внедрения в сообществе библиотека распространяется под лицензией Apache 2.0 и сопровождается всесторонней документацией и воспроизводимыми экспериментами. Снижая порог входа и стандартизируя практики оценки, Kiwano стремится стать ценным ресурсом как для академических исследований, так и для прикладной разработки. Проект доступен в открытом доступе на GitHub по адресу https://github.com/kiwano-toolkit/kiwano/.
Kiwano: открытая библиотека PyTorch для исследований в области верификации говорящих
Запущена открытая таблица лидеров по TTS для масштабируемой многоязычной оценки
Открытая таблица лидеров по TTS была выпущена для решения проблем фрагментации и отсутствия стандартизации в оценке синтеза речи (TTS) за счёт использования объективных метрик вместо опоры исключительно на медленные результаты предпочтений людей, полученные методом арены. Она оценивает модели по понятности, скорости и сходству голоса с использованием Qwen3 ASR и эмбеддингов WavLM.
Hume выпустила бенчмарк Real World VoiceEQ для оценки качества голоса в реальных условиях
Компания Hume представила Real World VoiceEQ, бенчмарк, предназначенный для оценки качества человеческого взаимодействия с голосом путем анализа того, насколько хорошо системы распознают и воспроизводят акустическую информацию помимо текстовой транскрипции. Бенчмарк оценивает более 40 проприетарных и open-source моделей по более чем 15 измерениям с использованием свыше 60 метрик, полученных на основе 785 000 оценок TTS и 48 000 оценок STS от людей.
Claude Opus 5 и Tetsu обнаружили шесть пустых проверок CI в собственном проекте
27 сентября Claude Opus 5 и модель Tetsu объёмом 3B выявили шесть отдельных проверок непрерывной интеграции в их публичном репозитории, которые показывали зелёный статус или проходили, несмотря на то, что не проверяли то, что должны были измерять. Проблемы варьировались от шлюза развертывания, отказывающегося принимать корректные перезапуски из-за устаревших дайджестов, до бенчмарков времени с пустыми порогами, принимающими пренебрежимо малые различия в производительности.
TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом
Исследователи представляют модель синтеза речи из текста TontaubeV1, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одном потребительском GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что обеспечивает генерацию с низкой задержкой.
TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом
Исследователи представляют TontaubeV1 — модель преобразования текста в речь, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одной потребительской GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что позволяет осуществлять каузальное декодирование, несмотря на некаузальный характер базового кодека.