Библиотека tokenizers выпустила кандидат в релизы версии 1, который значительно улучшает производительность кодирования текста, устраняя узкие места в рабочих процессах обучения и обслуживания. Обновление сохраняет совместимость API с версией v0.23, обеспечивая существенное ускорение для десяти семейств моделей.

  • Кодирование выполняется в 3–30 раз быстрее, чем в v0.23, на одном потоке за счёт замены разбиения регулярными выражениями операциями с битовым потоком через библиотеку bitcannon.
  • Потоко-локальный кэш слов хранит результаты для повторяющихся пре-токенов, позволяя последующим вхождениям полностью пропускать процесс слияния.
  • Цикл слияния BPE повторно использует временные буферы и обрабатывает пакеты пре-токенов за один вызов, устраняя выделения памяти при каждом вызове.
  • Масштабирование на восьми рабочих процессах достигает 76% от линейной производительности; пропускная способность декодирования также улучшена благодаря прямой записи в буферы.

Эти оптимизации гарантируют, что токенизация больше не будет лишать модели данных из-за простоя GPU в ожидании завершения обработки на CPU.