llama.cpp 프로젝트는 Vulkan 최적화를 포함하는 빌드 b11266를 출시했으며, 이는 2-정렬된 경우 F32 A 행렬을 한 번에 두 요소씩 로드합니다. 이 변경은 부동소수점을 하나씩 로드하는 것이 비효율적인 Intel 하드웨어의 성능 문제를 해결하고, 원래 패치에서 누락된 `a_offset` 정렬 검증도 수정합니다.
- 이 수정은 Intel BMG 아키텍처에서 처리량을 개선하기 위해 `mul_mat_vec`의 기존 2-정렬 로드 로직을 활용합니다.
- Intel B60에서의 벤치마크 결과는 특정 행렬 곱셈 형태에 대해 상당한 속도 향상을 보였으며, 한 테스트 케이스에서는 성능이 153.08 GFLOPS에서 221.66 GFLOPS로 증가했고 다른 테스트에서는 최대 1.63 TFLOPS에 도달했습니다.
- 이번 릴리스는 macOS(Apple Silicon 및 Intel), Linux(CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows, openEuler용 바이너리를 제공합니다.
이 업데이트는 부동소수점 행렬 연산에 대한 메모리 접근 패턴을 최적화하여 Vulkan 백엔드를 사용하는 Intel GPU의 추론 성능을 향상시킵니다.