ある研究により、最先端の言語モデルが意味的に無関係なフィラートークンを使用して重要な計算を実行できることが示され、推論が出力内の連鎖的思考(chain-of-thought)に現れないという失敗モードが生じることが明らかになった。この研究は3つのタスクで13個のモデルを評価し、多くのモデルがこれらのトークンから大幅な恩恵を受け、精度が最大13パーセントポイント向上することを発見した。
- フィラートークンはClaude Opus 4.5が主要なタスクの精度を犠牲にすることなく、隠れたモジュラ算術の制約を満たすことを可能にする。
- 強化学習はQwen3-235Bに対して特定のフィラートークン内容への強い好みをもたらすが、強化学習も教師ありファインチューニングもテスト時に持続する恩恵を生み出さない。
- パフォーマンスの恩恵は使用されるトークンに依存し、異なるモデル間で変化する。
これらの結果は、最先端モデルがすでに出力トークン内で解釈可能な痕跡のない計算を実行していることを示しており、不可視の推論が連鎖的思考監視に対して完全に不可視な目的を達成し得ることを実証している。