Muse-Ltd отправила UncertaintyGym в Hugging Face Evaluation Hub, новый бенчмарк, предназначенный для оценки метакогнитивной калибровки больших языковых моделей и их способности выражать неопределённость вместо галлюцинаций.
Бенчмарк разделяет запросы на четыре различных типа: разрешимые фактические вопросы, недостаточно определённые запросы, требующие уточнения, вопросы с ложной предпосылкой, требующие отклонения, и изначально неизвестные темы. В качестве основных метрик используются Метакогнитивный балл калибровки (MCS) и Скорость галлюцинаций на неустранимых вопросах; начальные базовые линии показывают, что модель LiquidAI's LFM2.5-2.6B достигает MCS 45,0%.
Эта подача призвана предоставить стандартизированный метод оценки того, насколько хорошо модели справляются с отсутствующим контекстом или невозможными предпосылками, явно объявляя их неизвестными.