O projeto llama.cpp lançou a versão b10833, introduzindo otimizações do backend Vulkan que fundem operações específicas de normalização para melhorar o desempenho de inferência.
- Suporte para fusão de RMS_NORM + MUL + ADD (+ MUL) e RMS_NORM + VIEW + SET_ROWS no backend Vulkan.
- Extensão de ROPE + VIEW + SET_ROWS para suportar IMROPE.
- O autor relata um ganho de desempenho de aproximadamente 4% em modelos gemma4 em seu sistema.
Esta atualização fornece aos usuários velocidades de inferência mais rápidas para modelos compatíveis executados em hardware compatível com Vulkan.