LLaMA.cpp는 macOS, Linux, Android, Windows 및 openEuler용 바이너리를 여러 아키텍처에 대해 버전 b9729로 출시했습니다. 이번 릴리스에는 CPU, Vulkan, OpenVINO, SYCL 및 ROCm 지원이 포함되며 새로운 UI 패키지도 제공됩니다. 내부 'webui' 참조가 제거되었습니다.
LLaMA.cpp b9729 릴리스: 새로운 바이너리 및 플랫폼 지원
llama.cpp b9741 릴리스: 새로운 바이너리 및 지원 추가
llama.cpp 버전 b9741은 여러 아키텍처에서 macOS, Linux, Android, Windows, openEuler용 새로운 바이너리를 도입합니다. 이번 릴리스에는 Vulkan, CUDA 12.4 및 13.3, OpenVINO, SYCL, ROCm에 대한 지원이 포함되며 iOS와 Ubuntu의 버전도 업데이트되었습니다.
ggml이 파티션 평활화를 통해 AMX 최적화
ggml 프로젝트는 모든 스레드가 양자화에 참여하도록 n_batch * M에 대한 파티션을 평활화하여 AMX 성능을 최적화했습니다. 이 변경은 CPU 및 GPU 플랫폼에서 다양한 모델과 하드웨어 구성에 걸쳐 최대 1.47배의 속도 향상을 가져왔으며, 추론 시간에서 일관된 개선 결과를 보여줍니다.
ggml-webgpu, Vulkan 및 NVIDIA용 F16 어댑터 토글 추가
ggml-webgpu 프로젝트는 Vulkan 및 NVIDIA GPU의 반정밀(F16) 지원을 위해 어댑터 토글을 추가했습니다. 이 업데이트는 macOS, Linux, Android, Windows 및 openEuler을 포함한 여러 플랫폼에서 호환 하드웨어의 성능을 향상시키며, ARM 및 x64 아키텍처용 특정 빌드를 제공합니다.
llama.cpp b9703 릴리스: 업데이트 및 바이너리 다운로드
llama.cpp 버전 b9703에는 서버의 프리셋 처리 재작업이 포함되어 있으며, 원격 HF 프리셋 지원과 더 이상 사용되지 않는 함수가 제거되었습니다. 이 릴리스는 macOS, Linux, Android, Windows 및 openEuler용 바이너리를 제공하며, Vulkan, CUDA, OpenVINO 및 SYCL을 포함한 여러 아키텍처와 하드웨어 가속 옵션을 지원합니다.
Metal 백엔드가 concat 연산자에 f16 및 bf16 지원 추가
llama.cpp의 Metal 백엔드는 기존 f32 및 i32 지원을 추가로 사용하여 concat 연산자에 대한 f16 및 bf16 텐서 유형을 지원하도록 확장되었습니다. 이 업데이트에는 전용 커널 템플릿, 업데이트된 파이프라인 getter, 개선된 유형 기반 커널 디스패치가 포함되며, pi:llama.cpp/Qwen3.6-27B의 도움으로 구현되었습니다.