O lançamento llama.cpp b10858 introduz a fusão de kernels Vulkan para ativações UNARY adjacentes (GELU, SIGMOID, SILU, SOFTPLUS) e operações MUL. Essa otimização recupera uma regressão de 10-18% na velocidade de processamento do prompt, eliminando acessos redundantes à memória e ramificações em tempo de execução.
- Os pipelines fundidos manipulam GELU, SIGMOID, SILU e SOFTPLUS com MUL, utilizando shaders SPIR-V especializados para f32 e f16.
- O otimizador de gráfico agora agenda pares fundidos mesmo quando separados por nós de computação zero como VIEW ou RESHAPE, estendendo o suporte a padrões encontrados em modelos como Gemma4.
- O suporte à fusão OP-on-B permite ativações no operando MUL menor, habilitando um gating eficiente em arquiteturas de especialistas compartilhados.
- Os testes do backend cobrem novos layouts incluindo 'gate' e 'view_mid' para validar a correção em várias formas de tensores.
A alteração melhora significativamente a latência de inferência para modelos que dependem fortemente de mecanismos de gating de ativação, reduzindo a sobrecarga computacional no backend Vulkan.