tokenizersライブラリは、テキストエンコーディングのパフォーマンスを大幅に改善し、トレーニングおよびサービングワークフローにおけるボトルネックに対処するバージョン1のリリース候補をリリースしました。このアップデートはv0.23とのAPI互換性を維持しつつ、10のモデルファミリー全体で著しい速度向上をもたらします。

  • ビットキャノンライブラリを用いたビットストリーム演算に正規表現分割を置き換えることで、シングルスレッドでのエンコーディング速度がv0.23と比較して3〜30倍高速化しました。
  • スレッドローカルの単語キャッシュは繰り返されるプレトークンの結果を保存し、後続の出現においてマージ処理を完全にスキップ可能にします。

-BPEマージループはスクラッチバッファを再利用し、プレトークンのバッチを1回の呼び出しで処理することで、呼び出しごとのメモリ割り当てを排除しました。

  • 8つのワーカーでのスケーリングにおいて線形性能の76%を達成し、直接バッファ書き込みによりデコーディングのスループットも改善されました。

これらの最適化により、GPUがCPU処理を待機してアイドル状態になることがなくなり、トークン化がモデルへのデータ供給を妨げなくなりました。