Les chercheurs proposent le Comptage et Filtrage (CNF) pour la construction du vocabulaire et l'Encodage à Coût Minimum (MCE) pour la segmentation du texte afin d'améliorer la tokenisation dans les grands modèles de langage. Cette combinaison offre une efficacité des tokens plus élevée, une évolutivité accrue et une dépendance réduite par rapport au Byte Pair Encoding (BPE).
- CNF construit un vocabulaire brut en comptant les sous-chaînes valides et le filtre en fonction de l'utilisation réelle lors de la segmentation MCE.
- MCE minimise une fonction de coût sur les segments de texte pour déterminer la segmentation globale optimale sans s'appuyer sur des listes de fusion ou des probabilités de tokens.
- Avec un vocabulaire de 250K, CNF-MCE augmente le taux de compression de 26 % et 30 % sur les textes web anglais par rapport aux tokenizers o200k_base et qwen250k.
- L'extension du vocabulaire à 1M entrées génère une amélioration de l'efficacité des tokens supérieure à 60 % et élève l'utilisation du vocabulaire de 52,9 % à 96,9 %.
- Les modèles de langage entraînés aux échelles 1,8B et 8B atteignent des performances comparables à celles des modèles basés sur BPE sur 11 benchmarks.
Les résultats démontrent que CNF-MCE améliore considérablement l'efficacité des tokens tout en maintenant des performances aval compétitives, applicable aux vocabulaires construits à partir de diverses méthodes.