El proyecto llama.cpp lanzó la versión b10833, introduciendo optimizaciones del backend de Vulkan que fusionan operaciones específicas de normalización para mejorar el rendimiento de inferencia.

  • Soporte para fusión de RMS_NORM + MUL + ADD (+ MUL) y RMS_NORM + VIEW + SET_ROWS en el backend de Vulkan.
  • Extensión de ROPE + VIEW + SET_ROWS para soportar IMROPE.
  • El autor reporta una ganancia de rendimiento de aproximadamente 4% en modelos gemma4 en su sistema.

Esta actualización proporciona a los usuarios velocidades de inferencia más rápidas para modelos compatibles que se ejecutan en hardware compatible con Vulkan.