연구자들은 대규모 언어 모델의 토큰화를 개선하기 위해 어휘 구축을 위한 카운팅 앤 필터링(CNFC)과 텍스트 분할을 위한 최소 비용 인코딩(MCE)을 제안합니다. 이 조합은 바이트 페어 인코딩(BPE) 대비 더 높은 토큰 효율성, 뛰어난 확장성, 낮은 의존성을 제공합니다.
- CNF는 유효한 부분 문자열을 세어 원시 어휘를 구축하고 MCE 분할 중 실제 사용량을 기반으로 이를 필터링합니다.
- MCE는 병합 목록이나 토큰 확률에 의존하지 않고 최적의 전역 분할을 결정하기 위해 텍스트 구간에 걸쳐 비용 함수를 최소화합니다.
- 250K 어휘 규모에서 CNF-MCE는 o200k_base 및 qwen250k 토크나이저 대비 영어 웹 텍스트에서 압축률을 각각 26%와 30% 향상시킵니다.
- 어휘를 1M 항목으로 확장하면 토큰 효율성이 60% 이상 개선되고 어휘 활용도가 52.9%에서 96.9%로 상승합니다.
- 1.8B 및 8B 규모로 학습된 언어 모델은 11개 벤치마크 전반에서 BPE 기반 모델과 비교 가능한 성능을 달성합니다.
이 결과는 CNF-MCE가 경쟁력 있는 다운스트림 성능을 유지하면서 토큰 효율성을 크게 향상시킨다는 것을 보여주며, 다양한 방법으로 구축된 어휘에 적용 가능합니다.