O projeto llama.cpp lançou a compilação b11227, que inclui otimizações de desempenho especificamente direcionadas ao manuseio da flag `causal_attn` durante o processamento multimodal.
- O escalonador não reserva mais memória ao alternar `causal_attn`, eliminando passagens caras que anteriormente desaceleravam as entradas visuais para modelos como Gemma.
- A forma do viés do indexador qwen4exp agora é independente de `causal_attn`, prevenindo falhas de realocação de buffer sob as restrições de `GGML_SCHED_NO_REALLOC`.
- Benchmarks no llama-server com gemma-4-26B-A4B mostram reduções significativas de latência, como um aumento de velocidade de 7.61x para 24 imagens na RTX 4090 e até 3.40x na H200 com configurações de contexto grande.
Essas mudanças melhoram a velocidade de inferência para entradas de múltiplas imagens e vídeo sem alterar a saída gerada ou o comportamento de reconstrução do grafo.