llama.cpp 프로젝트가 Apple의 M2 Max 하드웨어를 위한 특정 성능 최적화를 포함한 버전 b10739를 출시했습니다. 이 업데이트는 M2 Max의 30개 GPU 코어에 맞춰진 빠른 어텐션 벡터(fa-vec) 튜닝을 도입합니다.
- f16 및 q8_0 dtypes에서 ggml-metal-tuning으로 수집한 M2 Max용 fa-vec 튜닝 행 추가.
- macOS Apple Silicon, Intel Macs, iOS, Linux(CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows(CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler용 바이너리 제공.
이 릴리스는 다양한 운영 체제와 하드웨어 가속기 전반에 걸친 광범위한 지원을 유지하면서 최신 Apple silicon에서 최적화된 추론 성능을 보장합니다.