llama.cpp 프로젝트가 ggml 라이브러리와의 동기화를 버전 0.21.0으로 업그레이드한 버전 0.2.0을 출시했습니다. 이 업데이트는 다양한 하드웨어 플랫폼 전반에 걸쳐 여러 백엔드 개선 사항과 새로운 기능을 도입합니다.
- 호환되는 하드웨어에서 향상된 성능을 위해 Kleidiai SME2 F32 GEMV 커널 지원을 추가했습니다.
- 다중 GPU 분배를 개선하기 위해 LFM2 및 LFM2MOE 모델에 텐서 분할 기능을 활성화했습니다.
- 모델 로딩 파이프라인 내에서 LFM2 모델에 대한 DSpark 지원을 구현했습니다.
- Q2_K 재순서화 MMVQ, ESIMD 커널을 적용하고 Alchemist GPU 및 mlock 관련 문제를 수정하여 SYCL 백엔드를 업데이트했습니다.
- Adreno A6x/A7x 컴파일러 및 로컬 크기 계산에 대한 수정 사항을 적용하여 OpenCL 안정성을 개선했습니다.
- 멀티모달 투영의 장치 배치를 지정하기 위해 mtmd에 --mmproj-device 인수를 추가했습니다.
이번 출시에는 CI 정리, UI 설정 탐색 개선 사항, 그리고 CUDA, Metal, Vulkan 백엔드에 대한 다양한 버그 수정이 포함되어 있습니다.