Новое руководство описывает пошаговый процесс создания и обучения байтового BPE-токенизатора, основанного на первых принципах. В руководстве рассматриваются ключевые детали реализации, такие как предварительная токенизация с учетом Unicode, инкрементное обновление частоты пар и использование максимальной кучи с ленивым удалением.
- Обучение начинается с 256 сырых байтовых токенов и изучает слияния на многоязычном тексте.
- Реализован обратный индекс «пара-к-предтокену» для оптимизации процесса обучения.
- Модель обучалась на 100 МиБ данных mC4 по восьми языкам.
- В результате получается словарь из 8 192 токенов с 7 936 изученными слияниями.
- Обучение заняло примерно один час на процессоре M2 Pro с 12 ядрами и 32 ГБ памяти.
Автор предоставляет полный исходный код и пояснения через репозиторий GitHub, а также включает интерактивное демо для взаимодействия с пользовательским токенизатором.