O llama.cpp v0.6.0 apresenta a nova API de lote estendido llama_batch_ext para entradas mistas de tokens e embeddings, além do suporte ao modelo híbrido GLM-5.3-Flash 320B e ao modelo de decisão Clef.
- A nova API llama_batch_ext suporta embeddings de estado por token para modelos MTP e deepstack.
- O Qwen4Exp agora oferece suporte de alta qualidade com decodificação especulativa MTP, proporcionando um aumento de velocidade de decodificação de aproximadamente 1,5x no DGX Spark.
- Uma nova API de servidor /v1/systemone suporta cinco modelos de decisão: laya, julia-1, lev, openjev e kev.
- O Metal ganha um kernel flash attention para tensor-API para KV F16 e kernels MMA mat-mul até 3x mais rápidos em GPUs Apple.
- A Web UI recebe uma reformulação com uma camada de dados do Hugging Face Hub e um pipeline de download de modelos.
Este lançamento expande as capacidades do llama.cpp para processamento multimodal, desempenho de decodificação especulativa e integração de modelos de decisão.