tokenizersライブラリは、テキストエンコーディングのパフォーマンスを大幅に改善し、トレーニングおよびサービングワークフローにおけるボトルネックに対処するバージョン1のリリース候補をリリースしました。このアップデートはv0.23とのAPI互換性を維持しつつ、10のモデルファミリー全体で著しい速度向上をもたらします。
- ビットキャノンライブラリを用いたビットストリーム演算に正規表現分割を置き換えることで、シングルスレッドでのエンコーディング速度がv0.23と比較して3〜30倍高速化しました。
- スレッドローカルの単語キャッシュは繰り返されるプレトークンの結果を保存し、後続の出現においてマージ処理を完全にスキップ可能にします。
-BPEマージループはスクラッチバッファを再利用し、プレトークンのバッチを1回の呼び出しで処理することで、呼び出しごとのメモリ割り当てを排除しました。
- 8つのワーカーでのスケーリングにおいて線形性能の76%を達成し、直接バッファ書き込みによりデコーディングのスループットも改善されました。
これらの最適化により、GPUがCPU処理を待機してアイドル状態になることがなくなり、トークン化がモデルへのデータ供給を妨げなくなりました。