llama.cpp 프로젝트는 dsv4_hc_pre 커널에서 임의의 헤드 수(hc)를 지원하도록 metal 백엔드를 수정하는 빌드 b11064을 출시했습니다. 이전에는 이러한 커널에서 hc = 4가 하드코딩되어 다른 헤드 수를 가진 연산이 CPU 실행으로 폴백되었습니다.

  • 변경 사항은 n_hc를 함수 상수로 전달하고 직접 로드를 사용하여 두 개의 pre 커널 모두에서 루프합니다.
  • hc 값 1, 2, 3, 5, 8 및 65에 대한 test-backend-ops 케이스가 추가되어 게이트드 및 비게이트드 시나리오를 모두 커버했습니다.
  • 이 업데이트는 크로스 레이어 잔여 스택에서 동적 뱅크 체크포인트 카운트를 지원하여 Kimi-K3와 같은 모델이 GPU에서 효율적으로 실행될 수 있도록 합니다.

릴리스에는 CPU, CUDA, ROCm, Vulkan, OpenVINO 및 SYCL을 포함한 다양한 하드웨어 백엔드에 대한 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 포함되어 있습니다.