Библиотека tokenizers выпустила кандидат в релизы версии 1, который значительно улучшает производительность кодирования текста, устраняя узкие места в рабочих процессах обучения и обслуживания. Обновление сохраняет совместимость API с версией v0.23, обеспечивая существенное ускорение для десяти семейств моделей.
- Кодирование выполняется в 3–30 раз быстрее, чем в v0.23, на одном потоке за счёт замены разбиения регулярными выражениями операциями с битовым потоком через библиотеку bitcannon.
- Потоко-локальный кэш слов хранит результаты для повторяющихся пре-токенов, позволяя последующим вхождениям полностью пропускать процесс слияния.
- Цикл слияния BPE повторно использует временные буферы и обрабатывает пакеты пре-токенов за один вызов, устраняя выделения памяти при каждом вызове.
- Масштабирование на восьми рабочих процессах достигает 76% от линейной производительности; пропускная способность декодирования также улучшена благодаря прямой записи в буферы.
Эти оптимизации гарантируют, что токенизация больше не будет лишать модели данных из-за простоя GPU в ожидании завершения обработки на CPU.