El proyecto llama.cpp lanzó la versión b10870, introduciendo soporte Vulkan para pipelines de multiplicación matricial f16 tipo B y ajuste del tamaño de tile de warp específicamente para hardware Intel coopmat1.

  • Añadidos pipelines de multiplicación matricial f16 tipo B y ajuste del tamaño de tile de warp para Intel coopmat1.
  • Habilitado el pipeline f16 tipo B para multiplicación matricial densa en todos los proveedores, manteniendo el soporte Mixture of Experts (MoE) solo para Intel.
  • Añadidas las ramas OCP FP4 faltantes y restringido required_subgroup_size a Intel.
  • Simplificado y refinado la selección de mmp en mul_mat_id.

Esta actualización expande la compatibilidad Vulkan para operaciones matriciales específicas y refina la lógica interna de selección para mejorar la utilización del hardware.