El backend ggml-openvino para llama.cpp se ha actualizado a la versión 2026.4.1, introduciendo optimizaciones de rendimiento, soporte ampliado de operadores y una mejor enumeración de dispositivos.

  • Fusión del enrutamiento Mixture-of-Experts (MoE) y la normalización GDN QK, con la fusión GPU MoE habilitada por defecto.
  • Soporte para pesos gate-up fusionados en modelos como gemma-4, logrando un aumento del rendimiento de prefill desde 66.16 hasta 1608.73 t/s en Arc B390.
  • Corrección para el manejo del eje rank-3 en la ejecución con estado, resolviendo abortos en la construcción del grafo para modelos MoE.
  • Implementación de la enumeración de dispositivos y reporte de memoria conforme a PRD, asegurando una distinción precisa entre GPU e IGPU.
  • Adición de la opción k-requer q4_asym64 y el modo cache_only para importar modelos compilados directamente desde el disco.

Estos cambios mejoran el rendimiento de inferencia para arquitecturas MoE y proporcionan una detección y configuración de hardware más fiables para los usuarios de OpenVINO.