El proyecto llama.cpp lanzó la versión b10833, introduciendo optimizaciones del backend de Vulkan que fusionan operaciones específicas de normalización para mejorar el rendimiento de inferencia.
- Soporte para fusión de RMS_NORM + MUL + ADD (+ MUL) y RMS_NORM + VIEW + SET_ROWS en el backend de Vulkan.
- Extensión de ROPE + VIEW + SET_ROWS para soportar IMROPE.
- El autor reporta una ganancia de rendimiento de aproximadamente 4% en modelos gemma4 en su sistema.
Esta actualización proporciona a los usuarios velocidades de inferencia más rápidas para modelos compatibles que se ejecutan en hardware compatible con Vulkan.