O projeto llama.cpp lançou a compilação b11455, introduzindo suporte para a lógica de pré-segmentação do tokenizador PLaMo-3. Esta alteração implementa limites rígidos antes de executar o Unigram DP, especificamente ao redor de marcadores de texto específicos e sequências de caracteres idênticos ou espaços.
- Adicionado o tipo de vocabulário "plamo3" em src/llama-vocab.cpp para lidar com as novas regras de tokenização.
- Reproduzidas as passagens re.sub() da implementação de referência codificando cada segmento independentemente.
- Garante que a indentação do código e a pontuação repetida sejam tokenizadas de forma consistente com a referência PLaMo-3.
Esta atualização permite que o llama.cpp tokenize corretamente as entradas para os modelos PLaMo-3, correspondendo ao comportamento do tokenizador original.