Um novo tutorial documenta o processo passo a passo para construir e treinar um tokenizador BPE em nível de bytes a partir dos primeiros princípios. O guia cobre detalhes-chave de implementação, como pré-tokenização consciente de Unicode, atualizações incrementais de frequência de pares e uso de um max heap com deleção preguiçosa.

  • O treinamento começa com 256 tokens de bytes brutos e aprende fusões em texto multilíngue.
  • Um índice invertido par-pré-token é implementado para otimizar o processo de treinamento.
  • O modelo foi treinado em 100 MiB de dados mC4 em oito idiomas.
  • Isso resulta em um vocabulário de 8.192 tokens com 7.936 fusões aprendidas.
  • O treinamento levou cerca de uma hora em um M2 Pro de 12 núcleos com 32 GB de memória.

O autor fornece o código-fonte completo e explicações por meio de um repositório no GitHub e inclui uma demonstração ao vivo para que os usuários interajam com o tokenizador personalizado.