Proyek llama.cpp merilis build b11227, yang mencakup optimasi kinerja yang secara khusus menargetkan penanganan flag `causal_attn` selama pemrosesan multimodal.
- Scheduler tidak lagi memesan ulang memori saat mengaktifkan `causal_attn`, menghilangkan proses mahal yang sebelumnya memperlambat input visual untuk model seperti Gemma.
- Bentuk bias indexer qwen4exp sekarang independen dari `causal_attn`, mencegah kegagalan realokasi buffer di bawah batasan `GGML_SCHED_NO_REALLOC`.
- Benchmark pada llama-server dengan gemma-4-26B-A4B menunjukkan pengurangan latensi yang signifikan, seperti percepatan 7.61x untuk 24 gambar pada RTX 4090 dan hingga 3.40x pada H200 dengan pengaturan konteks besar.
Perubahan ini meningkatkan kecepatan inferensi untuk input multi-gambar dan video tanpa mengubah output yang dihasilkan atau perilaku rebuild graf.