A biblioteca tokenizers lançou um release candidate da versão 1 que melhora significativamente o desempenho para codificação de texto, abordando gargalos nos fluxos de trabalho de treinamento e serviço. A atualização mantém compatibilidade de API com a v0.23 enquanto entrega acelerações substanciais em dez famílias de modelos.

  • A codificação é de 3 a 30 vezes mais rápida que a v0.23 em um único thread, substituindo a divisão por regex por operações de bitstream por meio da biblioteca bitcannon.
  • Um cache de palavras local ao thread armazena resultados para pre-tokens repetidos, permitindo que ocorrências subsequentes pulem o processo de merge completamente.
  • O loop de merge BPE reutiliza buffers temporários e processa lotes de pre-tokens em uma única chamada, eliminando alocações de memória por chamada.
  • A escalabilidade entre oito workers alcança 76% do desempenho linear, com a taxa de decodificação também melhorada por meio de escritas diretas em buffer.

Essas otimizações garantem que a tokenização não mais prive os modelos de dados, impedindo que as GPUs fiquem ociosas enquanto aguardam o processamento da CPU.