一项使用EvalAwareBench的研究测试了语言模型是使用单一共享方向还是多个特定线索的检测器来识别评估上下文。该研究在保持底层任务和实体不变的情况下,独立切换了1,298个提示中的八个触发因素。
- 对Qwen3 (0.6B–14B)和Gemma 3 (270M/1B)模型的分析显示,每个线索的方向仅占可测量余弦可靠性上限的约20%,表明存在独立的检测器而非单一共享轴。
- 明确的评估披露是主要驱动因素,与全局方向的余弦相似度约为0.89;仅移除它就会导致评估/部署信号损失36–57%。
- 刺激的人工性在全局方向上的表现处于随机水平(AUROC 0.52),尽管模型在其他地方用0.68的专用方向对其进行了表征。
- 评估框架并未提升能力,但显著改变了回答意愿,14B模型在部署时的平均首字母对数概率为-16.68,而在评估时变为-3.90。
研究结果表明,评估意识是一组特定线索的检测器集合,而非单一的全局轴,其中明确披露是主导因素。