O llama.cpp 0.3.0 introduz suporte ao modelo multimodal dots3-note com um novo tipo de cache KV DSA-ISWA, além de suporte à previsão multi-token (MTP) para GLM-4.5-Air. A versão também adiciona capacidades de tensor-split para DeepSeek 4 e corrige problemas de rollback em múltiplas sequências.

  • O ggml é atualizado para v0.22.0, adicionando suporte a tensor-split ao meta-backend e aos kernels Metal por operação com compilação paralela.
  • O mtmd ganha suporte a visão/áudio dots3-note, decodificação WebP via ffmpeg e um algoritmo de redimensionamento preciso conforme o Pillow.
  • O DeepSeek 4 recebe modo tensor-split através da flag `-sm tensor` e correções para rollback com múltiplas sequências.
  • O servidor adiciona uma opção de depuração `LLAMA_SERVER_SLOTS_N_DIFF`, enquanto a interface web ganha navegação por abas no chat.

Esta atualização expande as capacidades multimodais do llama.cpp e melhora o desempenho e a estabilidade para arquiteturas de modelos específicas, como DeepSeek 4 e GLM-4.5-Air.