Pesquisadores propõem Contagem e Filtragem (CNF) para construção de vocabulário e Codificação de Custo Mínimo (MCE) para segmentação de texto, visando aprimorar a tokenização em grandes modelos de linguagem. Essa combinação oferece maior eficiência de tokens, escalabilidade superior e menor dependência em comparação com a Codificação por Par de Bytes (BPE).

  • O CNF constrói um vocabulário bruto contando substrings válidas e o filtra com base no uso real durante a segmentação do MCE.
  • O MCE minimiza uma função de custo sobre segmentos de texto para determinar a segmentação global ótima, sem depender de listas de fusão ou probabilidades de tokens.
  • Com um vocabulário de 250K, o CNF-MCE aumenta a taxa de compressão em 26% e 30% no texto da web em inglês em comparação aos tokenizadores o200k_base e qwen250k.
  • Aumentar o vocabulário para 1M entradas resulta em melhoria de mais de 60% na eficiência de tokens e eleva a utilização do vocabulário de 52,9% para 96,9%.
  • Modelos de linguagem treinados nas escalas de 1,8B e 8B alcançam desempenho comparável aos modelos baseados em BPE em 11 benchmarks.

Os resultados demonstram que o CNF-MCE melhora significativamente a eficiência de tokens enquanto mantém um desempenho competitivo em tarefas downstream, sendo aplicável a vocabulários construídos a partir de diversos métodos.