llama.cpp 0.3.0 introduce soporte para el modelo multimodal dots3-note con un nuevo tipo de caché KV DSA-ISWA, junto con soporte para predicción multi-tokeno (MTP) para GLM-4.5-Air. La versión también añade capacidades de tensor-split para DeepSeek 4 y corrige problemas de retroceso en secuencias múltiples.

  • ggml se actualiza a v0.22.0, añadiendo soporte de tensor-split al meta-backend y a los núcleos Metal por operación con compilación paralela.
  • mtmd gana soporte de visión/audio dots3-note, decodificación WebP mediante ffmpeg y un algoritmo de redimensionado preciso según Pillow.
  • DeepSeek 4 recibe el modo tensor-split mediante la bandera `-sm tensor` y correcciones para el retroceso con múltiples secuencias.
  • El servidor añade un depurador `LLAMA_SERVER_SLOTS_N_DIFF`, mientras que la interfaz web gana navegación por pestañas en el chat.

Esta actualización amplía las capacidades multimodales de llama.cpp y mejora el rendimiento y la estabilidad para arquitecturas de modelos específicas como DeepSeek 4 y GLM-4.5-Air.