Un nouveau tutoriel documente le processus étape par étape de la construction et de l'entraînement d'un tokeniseur BPE au niveau des octets à partir des premiers principes. Le guide couvre les détails clés de l'implémentation tels que la pré-tokenisation consciente de l'Unicode, les mises à jour incrémentales de la fréquence des paires et l'utilisation d'un tas maximum avec suppression paresseuse.

  • L'entraînement commence avec 256 jetons d'octets bruts et apprend des fusions sur du texte multilingue.
  • Un index inversé paire-vers-pré-jeton est implémenté pour optimiser le processus d'entraînement.
  • Le modèle a été entraîné sur 100 MiB de données mC4 dans huit langues.
  • Cela résulte en un vocabulaire de 8 192 jetons avec 7 936 fusions apprises.
  • L'entraînement a pris environ une heure sur un M2 Pro à 12 cœurs avec 32 Go de mémoire.

L'auteur fournit le code source complet et des explications via un dépôt GitHub et inclut une démo en direct pour que les utilisateurs interagissent avec le tokeniseur personnalisé.