La bibliothèque tokenizers a publié une version candidate pour la version 1 qui améliore considérablement les performances de l'encodage de texte, en résolvant les goulots d'étranglement dans les flux de travail d'entraînement et de service. La mise à jour maintient la compatibilité de l'API avec la v0.23 tout en offrant des accélérations substantielles sur dix familles de modèles.
- L'encodage est 3 à 30 fois plus rapide que la v0.23 sur un seul thread en remplaçant le fractionnement par regex par des opérations bitstream via la bibliothèque bitcannon.
- Un cache de mots local au thread stocke les résultats pour les pré-tokens répétés, permettant aux occurrences suivantes de sauter entièrement le processus de fusion.
- La boucle de fusion BPE réutilise les tampons temporaires et traite des lots de pré-tokens en un seul appel, éliminant les allocations mémoire par appel.
- Le passage à l'échelle sur huit travailleurs atteint 76 % des performances linéaires, avec un débit de décodage également amélioré grâce aux écritures directes dans les tampons.
Ces optimisations garantissent que le tokenization ne prive plus les modèles de données en empêchant les GPU de rester inactifs en attendant le traitement du CPU.