BabelJudge представляет открытую платформу для измерения четырех ключевых форм предвзятости в LLM-судьях в различных языках и траекториях агентов. Платформа выявляет значительное падение надежности от хинди до саванги — с 0,714 до 0,550 — что подчеркивает деградацию между языками, недоступную по прямой точности. Платформа позволяет проводить оценку с учетом предвзятости без использования человеческих меток, используя контролируемые искажения для создания известных эталонных меток, и расширяется на агентные рабочие процессы с новыми метриками по точности инструментов и обнаружению выдумки.
BabelJudge: Оценка надежности LLM-как-судьи в разных языках и траекториях агента
Стабилизация намерения инструмента в потоковом RAG
Исследование оценивает стабилизацию намерения инструмента в потоковом RAG, определяя момент, когда спекулятивные запросы на инструменты сходятся к правильным ответам. На бенчмарке CRAG 73,9% запросов позволяют значительное скрытие задержки, при этом ранняя стабилизация наблюдается в вопросах с прямым извлекаемым доказательством. Тип вопроса значительно предсказывает раннюю или позднюю стабилизацию, что позволяет определить, когда спекулятивные триггеры оказываются эффективными.
Calibra: Наблюдаемость наборов данных роботов для LeRobot
Calibra — это инструмент с открытым исходным кодом, предназначенный для аудита наборов данных роботов и выявления проблем с качеством перед обучением. Он предоставляет инструменты для создания ядер, учитывающих качество, и оценки результатов обучения.
Автор предлагает открытый реестр k для насыщения доказательствами в локальных LLM
Автор опубликовал пилотную статью и открытый реестр на Hugging Face для измерения точки насыщения доказательствами (k*) языковых моделей. Этот метрика определяет оптимальное количество фрагментов доказательств, которые следует внедрять в промпты, поскольку добавление большего количества контекста не монотонно улучшает корректность и может увеличить стоимость или эпистемическое загрязнение.
RAGU представляет многоэтапный движок GraphRAG с компактным экстрактором Meno-Lite-0.1
RAGU — это модульный движок GraphRAG с открытым исходным кодом, который улучшает интеграцию структурированных знаний за счёт разделения извлечения сущностей и их консолидации. Он использует двухэтапный процесс типизированного извлечения, дедупликацию на базе DBSCAN, суммаризацию LLM и обнаружение сообществ по алгоритму Leiden для снижения уровня шума и хрупкости, характерных для однопроходных систем.
Сигналы LLM-as-a-judge не оптимизируют закрытый цикл распознавания таблиц
Исследование с использованием FinTabNet и OmniDocBench демонстрирует, что сигналы LLM-as-a-judge недостаточны для оптимизации замкнутого цикла регенерации при распознавании таблиц. Исследование показывает, что оценки судей часто оказывались равными, рейтинги не были воспроизводимыми, а система не смогла восстановить лучшие кандидаты, созданные итерацией.