La biblioteca tokenizers ha lanzado una versión candidata a release 1 que mejora significativamente el rendimiento para la codificación de texto, abordando cuellos de botella en los flujos de trabajo de entrenamiento y servicio. La actualización mantiene compatibilidad con la API de v0.23 mientras proporciona aceleraciones sustanciales en diez familias de modelos.
- La codificación es de 3 a 30 veces más rápida que v0.23 en un solo hilo al reemplazar la división por regex con operaciones de bitstream mediante la biblioteca bitcannon.
- Una caché de palabras local al hilo almacena resultados para pre-tokens repetidos, permitiendo que las ocurrencias subsiguientes omitan completamente el proceso de fusión.
- El bucle de fusión BPE reutiliza búferes temporales y procesa lotes de pre-tokens en una sola llamada, eliminando las asignaciones de memoria por llamada.
- Escalar a través de ocho trabajadores alcanza el 76% del rendimiento lineal, con la mejora del throughput de decodificación también mediante escrituras directas de búfer.
Estas optimizaciones aseguran que la tokenización ya no prive a los modelos de datos al evitar que las GPUs permanezcan inactivas mientras esperan el procesamiento de la CPU.