Le projet llama.cpp a publié la compilation b11455, introduisant le support de la logique de pré-segmentation du tokenizeur PLaMo-3. Ce changement met en œuvre des limites strictes avant d'exécuter Unigram DP, spécifiquement autour de marqueurs textuels spécifiques et de séquences de caractères identiques ou d'espaces.

  • Ajout du type de vocabulaire "plamo3" dans src/llama-vocab.cpp pour gérer les nouvelles règles de tokenisation.
  • Reproduction des passes re.sub() de l'implémentation de référence en encodant chaque segment indépendamment.
  • Garantit que l'indentation du code et la ponctuation répétée sont tokenisées de manière cohérente avec la référence PLaMo-3.

Cette mise à jour permet à llama.cpp de tokeniser correctement les entrées pour les modèles PLaMo-3, correspondant au comportement du tokenizeur original.