ある研究は、「FragileTokens」と呼ばれる語彙項目を特徴づけている。これはオープンウェイト言語モデルにおける語彙エントリで、孤立した状態ではコピーに成功するが、周囲のテキスト中に埋め込まれるとエラーを示すものである。この研究は、標準的な孤立テストでは文字通りの同一性の保持が保証されないことを浮き彫りにしている。なぜなら、トークンはシーケンス内で削除されたり、置換されたり、切り詰められたりする可能性があるからである。

  • QwenおよびOLMoファミリー由来の8つのオープンウェイトモデルをテストした。これらは、異なる長さのランダムな共通語シーケンスに固定されたトークンIDを挿入して評価された。
  • 確率ベースのスクリーニングにより、孤立プローブを通過するトークンのうち0.4%から10.9%が、テストされた文脈の少なくとも10%で脆弱であることが示された。

削除、置換、切り詰め、翻訳といった特定の失敗モードを示し、集中した出力分布下であっても一部のエラーが発生することを明らかにした。

  • 幾何学的シグナルを評価した結果、入力および出力埋め込みの近接性は、7つのモデルにおいてこれらのトークンを識別するAUROCが0.744から0.881であることを示した。
  • 選択された脆弱な候補は、指示およびシミュレートされたツール使用タスクにおいて、安定した制御群よりも頻繁に保持されないことを示した。

これらの知見は、文脈検証プロトコルの使用を促すものであり、孤立プローブを通過することは、文字通りの信頼性に関する一般的な証明書として扱ってはならないと主張している。