研究者らは、大規模言語モデルにおけるトークン化を強化するために、語彙構築にCounting and Filtering (CNF)、テキストセグメンテーションにMin-Cost Encoding (MCE) を提案している。この組み合わせは、Byte Pair Encoding (BPE) と比較して、より高いトークン効率、優れたスケーラビリティ、および低い依存性をもたらす。
- CNFは有効な部分文字列の数を数えて生語彙を構築し、MCEセグメンテーション中の実際の使用に基づいてそれをフィルタリングする。
- MCEはマージリストやトークン確率に頼らず、最適なグローバルセグメンテーションを決定するためにテキストセグメント全体でコスト関数を最小化する。
- 250Kの語彙サイズにおいて、CNF-MCEはo200k_baseおよびqwen250kトークナイザーと比較して英語ウェブテキスト上で圧縮率をそれぞれ26%および30%向上させる。
- 語彙を1Mエントリにスケールアップすると、トークン効率の改善が60%を超え、語彙利用率は52.9%から96.9%に上昇する。
- 1.8Bおよび8B規模で学習された言語モデルは、11のベンチマークにおいてBPEベースのモデルと同等のパフォーマンスを達成している。
これらの結果は、CNF-MCEが下流タスクでの競争力のあるパフォーマンスを維持しつつトークン効率を大幅に改善することを示しており、様々な手法で構築された語彙に適用可能である。