O lançamento do llama.cpp b10981 aborda problemas críticos de correção no caminho de decodificação com estado do backend OpenVINO, corrigindo especificamente o suporte para modelos como Gemma-4 que usam tamanhos de cabeça por camada. Também introduz otimizações para inferência de Mixture of Experts (MoE) em GPU e melhora o desempenho por meio de relayouts do estado KV.
- Corrige falhas no decode com estado para Gemma-4 manipulando corretamente as contagens de cabeças por tipo de camada e camadas de janela deslizante.
- Melhora o desempenho da decodificação com estado em GPU, com gemma-4-12B aumentando de 6.27 para 9.11 t/s na profundidade 8192.
- Adiciona suporte para GGML_OPENVINO_REQUANT_KQUANT para selecionar um alvo de requantização de 4 bits e GGML_OPENVINO_SPILL_DIR para despejar buffers de peso no disco.
- Otimiza a inferência de GPU MoE fundindo o bloco de especialista em MOECompressed e requantizando especialistas agrupados de 8 bits.
- Habilita modelos de codificador sem cache em NPU aceitando vistas RoPE QKV empacotadas e detectando atenção sem cache a partir de máscaras.
- Corrige operações ADD/SWIGLU_CLAMP com dtype misto fazendo upcast dos tipos de operando incompatíveis para f32 para preservar a precisão.
Essas alterações garantem inferência precisa para arquiteturas complexas de modelos como Gemma-4, ao mesmo tempo que fornecem acelerações mensuráveis para decodificação com estado e cargas de trabalho MoE em hardware compatível.