Um novo tutorial documenta o processo passo a passo para construir e treinar um tokenizador BPE em nível de bytes a partir dos primeiros princípios. O guia cobre detalhes-chave de implementação, como pré-tokenização consciente de Unicode, atualizações incrementais de frequência de pares e uso de um max heap com deleção preguiçosa.
- O treinamento começa com 256 tokens de bytes brutos e aprende fusões em texto multilíngue.
- Um índice invertido par-pré-token é implementado para otimizar o processo de treinamento.
- O modelo foi treinado em 100 MiB de dados mC4 em oito idiomas.
- Isso resulta em um vocabulário de 8.192 tokens com 7.936 fusões aprendidas.
- O treinamento levou cerca de uma hora em um M2 Pro de 12 núcleos com 32 GB de memória.
O autor fornece o código-fonte completo e explicações por meio de um repositório no GitHub e inclui uma demonstração ao vivo para que os usuários interajam com o tokenizador personalizado.