llama.cpp 프로젝트는 멀티모달 처리 중 `causal_attn` 플래그 처리를 특별히 대상으로 하는 성능 최적화를 포함하는 빌드 b11227을 출시했습니다.
- 스케줄러가 `causal_attn` 토글링 시 메모리를 다시 예약하지 않아, 이전에 Gemma와 같은 모델의 시각적 입력 속도를 늦추었던 비용이 많이 드는 패스가 제거되었습니다.
- qwen4exp 인덱서 바이어스 모양이 이제 `causal_attn`과 독립적이 되어 `GGML_SCHED_NO_REALLOC` 제약 조건 하에서 버퍼 재할당 실패를 방지합니다.
- gemma-4-26B-A4B가 포함된 llama-server의 벤치마크는 RTX 4090에서 24장 이미지에 대해 7.61x 속도 향상, H200에서 큰 컨텍스트 설정으로 최대 3.40x 속도 향상 등 상당한 지연 시간 감소를 보여줍니다.
이러한 변경은 생성된 출력이나 그래프 재빌딩 동작을 변경하지 않고 다중 이미지 및 비디오 입력에 대한 추론 속도를 개선합니다.