새로운 튜토리얼은 제1원리에서 바이트 레벨 BPE 토크나이저를 구축하고 학습하는 단계별 과정을 문서화합니다. 가이드는 유니코드 인식 사전 토큰화, 증분 페어 빈도 업데이트 및 지연 삭제가 있는 최대 힙 사용 등 주요 구현 세부 사항을 다룹니다.
- 학습은 256개의 원시 바이트 토큰에서 시작하여 다국어 텍스트에서 병합을 학습합니다.
- 학습 프로세스를 최적화하기 위해 페어-투-사전토큰 역색인을 구현했습니다.
- 모델은 8개 언어의 100 MiB mC4 데이터로 학습되었습니다.
- 그 결과, 7,936개의 학습된 병합과 함께 8,192 토큰 어휘가 생성됩니다.
- 32 GB 메모리가 탑재된 12코어 M2 Pro에서 학습에는 약 1시간이 걸렸습니다.
저자는 GitHub 저장소를 통해 전체 소스 코드와 설명을 제공하며, 사용자가 사용자 정의 토크나이저와 상호 작용할 수 있는 라이브 데모도 포함합니다.