Исследователи предлагают подсчёт и фильтрацию (CNF) для построения словаря и кодирование минимальной стоимости (MCE) для сегментации текста, чтобы улучшить токенизацию в больших языковых моделях. Эта комбинация обеспечивает более высокую эффективность токенов, лучшую масштабируемость и меньшую зависимость по сравнению с кодированием пар байтов (BPE).

  • CNF строит сырой словарь путём подсчёта допустимых подстрок и фильтрует его на основе фактического использования при сегментации MCE.
  • MCE минимизирует функцию стоимости по сегментам текста для определения оптимальной глобальной сегментации без опоры на списки слияний или вероятности токенов.
  • При словаре размером 250K CNF-MCE увеличивает скорость сжатия на 26% и 30% на английских веб-текстах по сравнению с токенизаторами o200k_base и qwen250k.
  • Увеличение размера словаря до 1M элементов даёт улучшение эффективности токенов более чем на 60% и повышает использование словаря с 52,9% до 96,9%.
  • Языковые модели, обученные в масштабах 1.8B и 8B, достигают сопоставимой производительности с моделями на основе BPE по 11 бенчмаркам.

Результаты демонстрируют, что CNF-MCE значительно улучшает эффективность токенов, сохраняя конкурентоспособные результаты в downstream-задачах, и применимо к словарям, построенным различными методами.