O projeto llama.cpp lançou a versão b10212, que inclui uma alteração para carregar os tensores de Multi-Token Prediction (MTP) apenas se forem realmente utilizados. Esta atualização garante que os tensores MTP sejam ignorados durante o carregamento nos modelos restantes que suportam o recurso, mas não o exigem.
- Carregar tensores MTP condicionalmente com base no uso.
- Ignorar o carregamento de MTP em modelos compatíveis onde não é necessário.
Esta otimização reduz a sobrecarga desnecessária de memória para modelos que não utilizam Multi-Token Prediction.