llama.cpp v0.6.0 introduce la nueva API de lotes extendida llama_batch_ext para entradas mixtas de tokens y embeddings, junto con el soporte para el modelo híbrido GLM-5.3-Flash 320B y el modelo de decisión Clef.
- La nueva API llama_batch_ext soporta embeddings de estado por token para modelos MTP y deepstack.
- Qwen4Exp ahora ofrece un soporte de alta calidad con descodificación especulativa MTP, proporcionando una aceleración de decodificación de aproximadamente 1.5x en DGX Spark.
- Una nueva API de servidor /v1/systemone soporta cinco modelos de decisión: laya, julia-1, lev, openjev y kev.
- Metal obtiene un kernel de flash attention para tensor-API con KV F16 y kernels de mat-mul MMA hasta 3x más rápidos en GPUs Apple.
- La Web UI recibe una renovación con una capa de datos de Hugging Face Hub y una tubería de descarga de modelos.
Esta versión amplía las capacidades de llama.cpp para el procesamiento multimodal, el rendimiento de descodificación especulativa y la integración de modelos de decisión.