Проект llama.cpp выпустил сборку b11227, включающую оптимизации производительности, специально направленные на обработку флага `causal_attn` при мультимодальной обработке.
- Планировщик больше не перераспределяет память при переключении `causal_attn`, устраняя дорогие проходы, которые ранее замедляли обработку визуальных входных данных для моделей вроде Gemma.
- Форма смещения индексатора qwen4exp теперь независима от `causal_attn`, предотвращая сбои перераспределения буфера при ограничениях `GGML_SCHED_NO_REALLOC`.
- Тесты llama-server с gemma-4-26B-A4B показывают значительное снижение задержек, например, ускорение в 7.61 раза для 24 изображений на RTX 4090 и до 3.40x на H200 при больших настройках контекста.
Эти изменения улучшают скорость вывода для входных данных с несколькими изображениями и видео без изменения генерируемого вывода или поведения перестроения графа.