llama.cpp 프로젝트는 추론 성능을 개선하기 위해 특정 정규화 연산을 융합하는 Vulkan 백엔드 최적화를 도입한 버전 b10833을 출시했습니다.

  • Vulkan 백엔드에서 RMS_NORM + MUL + ADD (+ MUL) 및 RMS_NORM + VIEW + SET_ROWS 융합 지원.
  • IMROPE를 지원하기 위한 ROPE + VIEW + SET_ROWS 확장.
  • 작성자는 자신의 시스템에서 gemma4 모델에 대해 약 4%의 성능 향상을 보고했습니다.

이 업데이트는 Vulkan 호환 하드웨어에서 실행되는 호환 모델에 대해 더 빠른 추론 속도를 제공합니다.