ByteLexの研究チームは、11のトークナイザー語彙から座標空間を構築し、バイトレベル言語モデルがどの架空の単語で失敗するかを予測しました。このマップは、モデルの測定された単語ごとの精度と-0.98のスピアマン相関を示し、コーパス由来の統計情報を上回りました。

  • モデルは、トークン化なしの生UTF-8でトレーニングされた237Mパラメータのバイトレベル言語モデルです。
  • エラーは主に最初のバイトに依存しており、英語のバイト事前分布が回答を乗っ取っていることがわかりました。
  • このマップは、予測された弱点に対するターゲット訓練データを生成するために使用されました。
  • 修正適用後、ホールドアウト精度は.53/.40から.84/.79に向上しました。

このアプローチにより、開発者は既存のトークナイザーの構造的解析のみを使用して、トークナライザーなしモデルの特定の失敗モードを特定し修正することができます。