O projeto llama.cpp lançou a versão b10833, introduzindo otimizações do backend Vulkan que fundem operações específicas de normalização para melhorar o desempenho de inferência.

  • Suporte para fusão de RMS_NORM + MUL + ADD (+ MUL) e RMS_NORM + VIEW + SET_ROWS no backend Vulkan.
  • Extensão de ROPE + VIEW + SET_ROWS para suportar IMROPE.
  • O autor relata um ganho de desempenho de aproximadamente 4% em modelos gemma4 em seu sistema.

Esta atualização fornece aos usuários velocidades de inferência mais rápidas para modelos compatíveis executados em hardware compatível com Vulkan.