llama.cpp 프로젝트는 Metal 백엔드에 GGML_TYPE_TQ2_0 삼원 양자화 유형에 대한 지원을 도입하는 빌드 b10414를 출시했습니다. 이 업데이트에는 연속 텐서(cont) mul_mv 커널의 최적화도 포함되어 있습니다.

  • Metal 백엔드에 GGML_TYPE_TQ2_0(삼원, 요소당 2비트) 지원 추가.
  • 정수 연산에서 부동 소수점 연산으로 전환하여 mul_mv 커널 최적화.
  • 사전 계산된 합, 호이스팅된 계수 및 연속 y 로드를 통해 성능 개선.

이 릴리스는 CPU, CUDA, Vulkan, ROCm, SYCL을 포함한 다양한 하드웨어 백엔드에 대해 macOS, Linux, Windows, Android, openEuler용 업데이트된 바이너리를 제공합니다.