Los investigadores proponen Conteo y Filtrado (CNF) para la construcción del vocabulario y Codificación de Costo Mínimo (MCE) para la segmentación de texto con el fin de mejorar la tokenización en modelos de lenguaje grandes. Esta combinación ofrece mayor eficiencia de tokens, mayor escalabilidad y menor dependencia en comparación con Byte Pair Encoding (BPE).
- CNF construye un vocabulario crudo contando subcadenas válidas y lo filtra basándose en el uso real durante la segmentación MCE.
- MCE minimiza una función de costo sobre segmentos de texto para determinar la segmentación global óptima sin depender de listas de fusión ni probabilidades de tokens.
- Con un vocabulario de 250K, CNF-MCE aumenta la tasa de compresión en un 26% y 30% en texto web en inglés en comparación con los tokenizadores o200k_base y qwen250k.
- Escalar el vocabulario a 1M entradas produce una mejora de eficiencia de tokens superior al 60% y eleva la utilización del vocabulario del 52,9% al 96,9%.
- Los modelos de lenguaje entrenados en escalas de 1.8B y 8B logran un rendimiento comparable al de los modelos basados en BPE a través de 11 benchmarks.
Los resultados demuestran que CNF-MCE mejora significativamente la eficiencia de tokens mientras mantiene un rendimiento competitivo en tareas posteriores, aplicable a vocabularios construidos a partir de varios métodos.