La versión b10981 de llama.cpp aborda problemas críticos de corrección en la ruta de decodificación con estado del backend OpenVINO, corrigiendo específicamente el soporte para modelos como Gemma-4 que utilizan tamaños de cabeza por capa. También introduce optimizaciones para la inferencia de MoE (Mixture of Experts) en GPU y mejora el rendimiento mediante relayouts del estado KV.

  • Corrige las fallas de decodificación con estado para Gemma-4 manejando correctamente los conteos de cabeza por tipo de capa y las capas de ventana deslizante.
  • Mejora el rendimiento de la decodificación con estado en GPU, donde gemma-4-12B aumenta de 6.27 a 9.11 t/s a una profundidad de 8192.
  • Añade soporte para GGML_OPENVINO_REQUANT_KQUANT para seleccionar un objetivo de requantización de 4 bits y GGML_OPENVINO_SPILL_DIR para volcar los búferes de pesos al disco.
  • Optimiza la inferencia de MoE en GPU fusionando el bloque de expertos en MOECompressed y requantizando los expertos agrupados de 8 bits.
  • Habilita modelos de codificador sin caché en NPU aceptando vistas QKV RoPE empaquetadas y detectando atención sin caché a partir de máscaras.
  • Corrige las operaciones ADD/SWIGLU_CLAMP de tipo mixto realizando un upcast de los tipos de operando no coincidentes a f32 para preservar la precisión.

Estos cambios aseguran una inferencia precisa para arquitecturas de modelos complejas como Gemma-4, mientras proporcionan aceleraciones medibles para cargas de trabajo de decodificación con estado y MoE en hardware compatible.