Le projet llama.cpp a publié la compilation b11455, introduisant le support de la logique de pré-segmentation du tokenizeur PLaMo-3. Ce changement met en œuvre des limites strictes avant d'exécuter Unigram DP, spécifiquement autour de marqueurs textuels spécifiques et de séquences de caractères identiques ou d'espaces.
- Ajout du type de vocabulaire "plamo3" dans src/llama-vocab.cpp pour gérer les nouvelles règles de tokenisation.
- Reproduction des passes re.sub() de l'implémentation de référence en encodant chaque segment indépendamment.
- Garantit que l'indentation du code et la ponctuation répétée sont tokenisées de manière cohérente avec la référence PLaMo-3.
Cette mise à jour permet à llama.cpp de tokeniser correctement les entrées pour les modèles PLaMo-3, correspondant au comportement du tokenizeur original.