El proyecto llama.cpp lanzó la compilación b10672, que actualiza el backend de OpenVINO a la versión 2026.3.1 y añade soporte para modelos Whisper.cpp en la NPU.

  • El backend de OpenVINO ahora fusiona las convoluciones IM2COL + MatMul en una única operación de convolución de OpenVINO.
  • Los modelos Qwen3.5 están habilitados para ejecución en la NPU a través del backend actualizado.
  • Se admiten nuevas operaciones, incluidas RELU, POOL_2D, QUICK_GEGLU y ROLL, en el backend de OpenVINO.
  • Se corrigió el manejo de formas estáticas para solucionar problemas de propagación de dimensiones de ranuras dinámicas e independencia del conteo de tokens.
  • Se corrigió la lógica de prellenado fragmentado para evitar que los tokens rellenos se fusionen permanentemente en la caché recurrente.
  • Una nueva variable de entorno GGML_OPENVINO_NPU_COMPILE_CONFIG permite a los usuarios configurar parámetros de compilación de NPU, como optimization-level=3.

Esta actualización mejora el rendimiento de inferencia y la compatibilidad de modelos para usuarios de OpenVINO, especialmente aquellos que apuntan a NPUs de Intel.