Исследование с использованием EvalAwareBench проверяет, используют ли языковые модели единое общее направление или несколько детекторов, специфичных для подсказок, для идентификации контекстов оценки. В исследовании независимо изменялись восемь триггерных факторов в 1298 промптах при фиксированных базовых задачах и сущностях.
- Анализ моделей Qwen3 (0.6B–14B) и Gemma 3 (270M/1B) показывает, что направления для каждой подсказки занимают лишь ~20% от измеримого потолка косинусной надёжности, что указывает на наличие различных детекторов, а не одной общей оси.
- Явное раскрытие информации об оценке является основным драйвером, с косинусным сходством ~0.89 к глобальному направлению; его удаление само по себе снижает сигнал оценки/развёртывания на 36–57%.
- Искусственность стимула определяется на уровне случайного угадывания (AUROC 0.52) в глобальном направлении, хотя модель представляет её в другом месте с помощью выделенного направления 0.68.
- Фрейминг оценки не улучшает возможности модели, но существенно меняет готовность отвечать: среднее логарифмическое вероятности верхней буквы смещается с -16.68 при развёртывании до -3.90 при оценке для модели 14B.
Полученные результаты указывают на то, что осведомлённость об оценке представляет собой набор детекторов, специфичных для подсказок, а не единую глобальную ось, при этом явное раскрытие информации является доминирующим фактором.