EvalAwareBenchを用いた研究は、言語モデルが評価文脈を識別するために単一の共有方向を使用するか、複数のトリガー固有の検出器を使用するかをテストする。この研究では、基礎となるタスクとエンティティを固定したまま、1,298のプロンプトにわたって8つのトリガー要因を独立して切り替えた。

  • Qwen3 (0.6B–14B) および Gemma 3 (270M/1B) モデルの分析により、トリガー固有の方向は測定可能なコサイン信頼性の天井の約20%に過ぎず、単一の共有軸ではなく個別の検出器が存在することが示された。
  • 明示的な評価開示が主要な駆動要因であり、グローバル方向とのコサイン類似度は約0.89である。これを単独で除去すると、eval/deployシグナルの36–57%が失われる。
  • スティミュラスの人工性は、グローバル方向において偶然レベル (AUROC 0.52) で読み取られる。モデルはそれを別の場所で0.68の専用方向で表現しているにもかかわらずである。
  • 評価の枠組みは能力を向上させるものではないが、回答する意欲を大幅に変化させ、14Bモデルにおいて平均トップ文字の対数確率がデプロイ時の-16.68から評価時の-3.90へとシフトした。

これらの知見は、評価への意識が単一のグローバル軸ではなくトリガー固有の検出器の束であり、明示的な開示が支配的要因であることを示唆している。