Para peneliti mengusulkan Counting and Filtering (CNF) untuk konstruksi kosakata dan Min-Cost Encoding (MCE) untuk segmentasi teks guna meningkatkan tokenisasi pada model bahasa besar. Kombinasi ini menawarkan efisiensi token yang lebih tinggi, skalabilitas yang lebih besar, dan ketergantungan yang lebih rendah dibandingkan Byte Pair Encoding (BPE).
- CNF membangun kosakata mentah dengan menghitung substring valid dan memfilternya berdasarkan penggunaan aktual selama segmentasi MCE.
- MCE meminimalkan fungsi biaya pada segmen teks untuk menentukan segmentasi global optimal tanpa bergantung pada daftar penggabungan atau probabilitas token.
- Dengan kosakata 250K, CNF-MCE meningkatkan laju kompresi sebesar 26% dan 30% pada teks web bahasa Inggris dibandingkan dengan tokenizer o200k_base dan qwen250k.
- Skala kosakata hingga 1M entri menghasilkan peningkatan efisiensi token lebih dari 60% dan menaikkan utilisasi kosakata dari 52,9% menjadi 96,9%.
- Model bahasa yang dilatih pada skala 1.8B dan 8B mencapai kinerja yang sebanding dengan model berbasis BPE di seluruh 11 benchmark.
Hasilnya menunjukkan bahwa CNF-MCE secara signifikan meningkatkan efisiensi token sambil mempertahankan kinerja downstream yang kompetitif, dapat diterapkan pada kosakata yang dibangun dari berbagai metode.