Лаборатория · Allen AI
media Hugging Face Forums · 10 д назад · 23 просмотра

Исследование выявляет FragileTokens, не справляющиеся с контекстным копированием, несмотря на успешное прохождение изоляционных тестов

В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.

lab Hugging Face Blog · 21 д назад · 28 просмотров

BenchMIRT проверяет бенчмарки LLM, разделяя сигналы безопасности и рассуждения

Исследователи представляют BenchMIRT, метод аудита бенчмарков больших языковых моделей на уровне отдельных промптов с использованием многомерной теории ответа на вопрос (Item Response Theory). Анализируя результаты работы 100 моделей и 34 000 вопросов, инструмент разделяет смешанные способности, такие как безопасность и общее рассуждение, которые часто искажают оценки в бенчмарках.