ByteLex 연구원들은 11개 토크나이저 어휘에서 좌표 공간을 구축하여 바이트 레벨 언어 모델이 어떤 가상의 단어에서 실패할지 예측했습니다. 이 맵은 모델의 측정된 단어별 정확도와 -0.98의 스피어만 상관을 달성하여 코퍼스 기반 통계를 능가했습니다.
- 모델은 토큰화 없이 원시 UTF-8에서 훈련된 237M 파라미터 바이트 레벨 언어 모델입니다.
- 오류는 주로 첫 번째 바이트에 의존하며, 여기서 영어 바이트 사전 확률이 답변을 가로챕니다.
- 맵은 예측된 약점을 위한 표적 훈련 데이터를 생성하는 데 사용되었습니다.
- 수정 적용 후 홀드아웃 정확도가 .53/.40에서 .84/.79로 향상되었습니다.
이 접근 방식은 개발자가 기존 토크나이저의 구조적 분석만을 사용하여 토큰라이저 없는 모델의 특정 실패 모드를 식별하고 수정할 수 있게 합니다.