研究人员提出计数与过滤(CNF)用于词汇表构建,以及最小成本编码(MCE)用于文本分割,以增强大语言模型中的分词效果。与字节对编码(BPE)相比,这种组合提供了更高的令牌效率、更强的可扩展性以及更低的依赖关系。
- CNF 通过统计有效子串来构建原始词汇表,并根据 MCE 分割期间的实际使用情况对其进行过滤。
- MCE 在文本片段上最小化成本函数,以确定最优的全局分割,而无需依赖合并列表或令牌概率。
- 在使用 250K 词汇表时,与 o200k_base 和 qwen250k tokenizer 相比,CNF-MCE 在英文网页文本上的压缩率分别提高了 26% 和 30%。
- 将词汇表扩展至 1M 条目可带来超过 60% 的令牌效率提升,并将词汇表利用率从 52.9% 提高至 96.9%。
- 在 1.8B 和 8B 规模下训练的模型在 11 个基准测试中取得了与基于 BPE 的模型相当的性能。
结果表明,CNF-MCE 在保持具有竞争力的下游性能的同时,显著提高了令牌效率,适用于由各种方法构建的词汇表。