Proyek llama.cpp merilis build b11455, memperkenalkan dukungan untuk logika pra-segmentasi tokenizer PLaMo-3. Perubahan ini mengimplementasikan batas keras sebelum menjalankan Unigram DP, khususnya di sekitar penanda teks tertentu dan rangkaian karakter atau spasi yang identik.
- Menambahkan tipe vocab "plamo3" ke src/llama-vocab.cpp untuk menangani aturan tokenisasi baru.
- Mereplikasi pass re.sub() dari implementasi referensi dengan mengenkripsi setiap segmen secara independen.
- Memastikan indentasi kode dan tanda baca yang diulang ditokenisasi secara konsisten dengan referensi PLaMo-3.
Pembaruan ini memungkinkan llama.cpp untuk men-tokenisasi input dengan benar untuk model PLaMo-3, sesuai dengan perilaku tokenizer asli.