新しいチュートリアルでは、第一原理からバイトレベルのBPEトークナイザーを構築し学習する手順が文書化されています。ガイドでは、Unicode対応の事前トークン化、ペア頻度のインクリメンタル更新、遅延削除付き最大ヒープの使用など、実装の重要な詳細がカバーされています。

  • 学習は256個生のバイトトークンから始まり、多言語テキスト上でマージを学習します。
  • 学習プロセスを最適化するために、ペアから事前トークンへの逆インデックスが実装されています。
  • モデルは8つの言語の100 MiBのmC4データで学習されました。
  • その結果、7,936個のマージが学習された8,192トークンの語彙になります。
  • 32 GBのメモリを搭載した12コアのM2 Proで、学習には約1時間かかりました。

著者はGitHubリポジトリを通じて完全なソースコードと解説を提供しており、ユーザーがカスタムトークナイザーと対話できるライブデモも含まれています。