Sebuah tutorial baru mendokumentasikan proses langkah demi langkah untuk membangun dan melatih tokenizer BPE tingkat byte dari prinsip pertama. Panduan ini mencakup detail implementasi kunci seperti pre-tokenisasi yang sadar Unicode, pembaruan frekuensi pasangan secara inkremental, dan penggunaan max heap dengan penghapusan malas.

  • Pelatihan dimulai dari 256 token byte mentah dan mempelajari penggabungan pada teks multibahasa.
  • Indeks terbalik pasangan-ke-pretoken diimplementasikan untuk mengoptimalkan proses pelatihan.
  • Model dilatih pada 100 MiB data mC4 di delapan bahasa.
  • Hasilnya adalah kosakata berukuran 8.192 token dengan 7.936 penggabungan yang dipelajari.
  • Pelatihan memakan waktu sekitar satu jam pada M2 Pro 12 inti dengan memori 32 GB.

Penulis menyediakan kode sumber lengkap dan penjelasan melalui repositori GitHub serta menyertakan demo langsung agar pengguna dapat berinteraksi dengan tokenizer kustom.