BabelJudge представляет открытую платформу для измерения четырех ключевых форм предвзятости в LLM-судьях в различных языках и траекториях агентов. Платформа выявляет значительное падение надежности от хинди до саванги — с 0,714 до 0,550 — что подчеркивает деградацию между языками, недоступную по прямой точности. Платформа позволяет проводить оценку с учетом предвзятости без использования человеческих меток, используя контролируемые искажения для создания известных эталонных меток, и расширяется на агентные рабочие процессы с новыми метриками по точности инструментов и обнаружению выдумки.
BabelJudge: Оценка надежности LLM-как-судьи в разных языках и траекториях агента
Стабилизация намерения инструмента в потоковом RAG
Исследование оценивает стабилизацию намерения инструмента в потоковом RAG, определяя момент, когда спекулятивные запросы на инструменты сходятся к правильным ответам. На бенчмарке CRAG 73,9% запросов позволяют значительное скрытие задержки, при этом ранняя стабилизация наблюдается в вопросах с прямым извлекаемым доказательством. Тип вопроса значительно предсказывает раннюю или позднюю стабилизацию, что позволяет определить, когда спекулятивные триггеры оказываются эффективными.
Запущена открытая таблица лидеров по TTS для масштабируемой многоязычной оценки
Открытая таблица лидеров по TTS была выпущена для решения проблем фрагментации и отсутствия стандартизации в оценке синтеза речи (TTS) за счёт использования объективных метрик вместо опоры исключительно на медленные результаты предпочтений людей, полученные методом арены. Она оценивает модели по понятности, скорости и сходству голоса с использованием Qwen3 ASR и эмбеддингов WavLM.
Отравление устаревшими документами приводит к тому, что устаревший поиск перебивает правильные ответы модели
Исследователи выявили «отравление устаревшими документами» — сбой временной синхронизации в Retrieval-Augmented Generation (RAG), при котором устаревшие внешние данные заставляют модели давать неверные ответы, хотя без поиска они знают правильный ответ.
Claude Opus 5 и Tetsu обнаружили шесть пустых проверок CI в собственном проекте
27 сентября Claude Opus 5 и модель Tetsu объёмом 3B выявили шесть отдельных проверок непрерывной интеграции в их публичном репозитории, которые показывали зелёный статус или проходили, несмотря на то, что не проверяли то, что должны были измерять. Проблемы варьировались от шлюза развертывания, отказывающегося принимать корректные перезапуски из-за устаревших дайджестов, до бенчмарков времени с пустыми порогами, принимающими пренебрежимо малые различия в производительности.
pop123-ux выпускает 38 рабочих блокнотов для изучения Hugging Face путем устранения абстракций
Пользователь pop123-ux опубликовал обучающий репозиторий, содержащий 38 рабочих блокнотов, предназначенных для помощи пользователям в понимании стека Hugging Face за счет постепенного устранения высокоуровневых абстракций. Коллекция охватывает путь от основных компонентов, таких как transformers и tokenizers, до тонкой настройки, PEFT, рассуждений/RL и работы над проектами от начала до конца.