Pustaka tokenizers telah merilis kandidat rilis versi 1 yang secara signifikan meningkatkan kinerja untuk pengodean teks, mengatasi hambatan dalam alur kerja pelatihan dan penyajian. Pembaruan ini mempertahankan kompatibilitas API dengan v0.23 sambil memberikan percepatan substansial di seluruh sepuluh keluarga model.
- Pengodean 3 hingga 30 kali lebih cepat daripada v0.23 pada satu utas dengan mengganti pemisahan regex dengan operasi bitstream melalui pustaka bitcannon.
- Cache kata lokal utas menyimpan hasil untuk pra-token yang diulang, memungkinkan kemunculan berikutnya melewatkan proses penggabungan sepenuhnya.
- Loop penggabungan BPE menggunakan kembali buffer sementara dan memproses batch pra-token dalam satu panggilan, menghilangkan alokasi memori per panggilan.
- Skala melintasi delapan pekerja mencapai 76% dari kinerja linear, dengan throughput dekoding juga meningkat melalui penulisan buffer langsung.
Optimasi ini memastikan bahwa tokenisasi tidak lagi membuat model kelaparan data dengan menjaga GPU agar tidak menganggur sambil menunggu pemrosesan CPU.