O lançamento do llama.cpp b10981 aborda problemas críticos de correção no caminho de decodificação com estado do backend OpenVINO, corrigindo especificamente o suporte para modelos como Gemma-4 que usam tamanhos de cabeça por camada. Também introduz otimizações para inferência de Mixture of Experts (MoE) em GPU e melhora o desempenho por meio de relayouts do estado KV.

  • Corrige falhas no decode com estado para Gemma-4 manipulando corretamente as contagens de cabeças por tipo de camada e camadas de janela deslizante.
  • Melhora o desempenho da decodificação com estado em GPU, com gemma-4-12B aumentando de 6.27 para 9.11 t/s na profundidade 8192.
  • Adiciona suporte para GGML_OPENVINO_REQUANT_KQUANT para selecionar um alvo de requantização de 4 bits e GGML_OPENVINO_SPILL_DIR para despejar buffers de peso no disco.
  • Otimiza a inferência de GPU MoE fundindo o bloco de especialista em MOECompressed e requantizando especialistas agrupados de 8 bits.
  • Habilita modelos de codificador sem cache em NPU aceitando vistas RoPE QKV empacotadas e detectando atenção sem cache a partir de máscaras.
  • Corrige operações ADD/SWIGLU_CLAMP com dtype misto fazendo upcast dos tipos de operando incompatíveis para f32 para preservar a precisão.

Essas alterações garantem inferência precisa para arquiteturas complexas de modelos como Gemma-4, ao mesmo tempo que fornecem acelerações mensuráveis para decodificação com estado e cargas de trabalho MoE em hardware compatível.