El proyecto llama.cpp lanzó la versión b10212, que incluye un cambio para cargar los tensores de Multi-Token Prediction (MTP) solo si realmente se utilizan. Esta actualización asegura que los tensores MTP se omitan durante la carga en los modelos restantes que admiten la función pero no la requieren.
- Cargar tensores MTP condicionalmente según su uso.
- Omitir la carga de MTP en modelos compatibles donde no es necesario.
Esta optimización reduce la sobrecarga innecesaria de memoria para los modelos que no utilizan Multi-Token Prediction.