llama.cpp 프로젝트가 Apple Silicon 하드웨어를 위한 Metal 백엔드에 상당한 업데이트를 도입한 빌드 b11059를 출시했습니다. 주요 변경 사항은 Fast Walsh-Hadamard Transform (FWHT) 커널에 F16 입력 지원이 추가되어 변환된 복사본 없이 F16 소스를 직접 읽을 수 있게 되었다는 것입니다.

  • Metal FWHT 커널은 이제 소스 타입을 템플릿 매개변수로 만들어 F16 입력을 허용하며, F32 인스턴스화는 변경되지 않았습니다.
  • FWHT SIMD 그룹 커널의 분기 없는 버터플라이 선택이 삼항 연산자를 대체하여 M5 Pro에서 대규모 Hadamard 행렬 곱셈 시 3.0% 성능 향상(1285.0 us 대 1324.6 us)을 가져왔습니다.
  • macos-latest-arm64 빌드를 수정하고 supports_op과 디스패치 로직 간 일관성을 보장하기 위해 디스패치 술어가 ggml-metal-common으로 이동되었습니다.
  • 이 릴리스에는 CPU, CUDA, ROCm, Vulkan, OpenVINO 및 SYCL 백엔드에 걸쳐 macOS, iOS, Linux, Windows, Android 및 openEuler용 바이너리가 포함되어 있습니다.

이 업데이트는 Metal 백엔드에서 F16 연산의 메모리 오버헤드와 지연 시간을 줄임으로써 Apple Silicon에서의 효율성을 향상시킵니다.