llama.cpp b11284가 양자화된 가중치 뷰에서 OpenVINO GET_ROWS를 수정함
llama.cpp 프로젝트는 양자화된 가중치 뷰에 대한 GET_ROWS 연산을 올바르게 처리하기 위한 OpenVINO 백엔드 수정 사항을 포함한 빌드 b11284를 출시했습니다.
llama.cpp 프로젝트는 양자화된 가중치 뷰에 대한 GET_ROWS 연산을 올바르게 처리하기 위한 OpenVINO 백엔드 수정 사항을 포함한 빌드 b11284를 출시했습니다.
llama.cpp 프로젝트는 고정 호스트 버퍼를 활용하여 텐서 allreduce 동기화를 줄이는 변경 사항이 포함된 버전 b11280을 출시했습니다.
llama.cpp 프로젝트는 `CUDA_ARCH` 매크로를 MUSA 디바이스 패스에 대해 정의하는 수정 사항을 포함하는 빌드 b11282를 출시했습니다. 이전에는 MUSA 벤더 헤더가 이 변수를 정의하지 않아 공유 ggml-cuda 소스의 아키텍처 테스트가 0으로 평가되고 빈 커널 본문이 생성되었습니다.
llama.cpp 프로젝트는 하이브리드 인덱스 메모리로의 마이그레이션 및 초기 Multi-Token Prediction (MTP) 기능을 포함하여 GLM-5.3-Flash (GLM5-Next) 모델 아키텍처에 대한 초기 지원을 추가했습니다.
llama.cpp 프로젝트가 빌드 b11273을 출시했으며, 이는 ModernBERT 아키텍처를 대상으로 리랭킹 모델에서 `classifier_pooling` 메서드에 대한 지원을 도입합니다.
llama.cpp 프로젝트는 Hexagon 백엔드에 대한 최적화를 포함한 빌드 b11272을 출시했습니다. 주요 변경 사항은 Qualcomm Snapdragon 하드웨어에서 성능을 향상시키기 위해 연결 연산을 최적화하는 것입니다.
llama.cpp 프로젝트는 Vulkan 최적화를 포함하는 빌드 b11266를 출시했으며, 이는 2-정렬된 경우 F32 A 행렬을 한 번에 두 요소씩 로드합니다. 이 변경은 부동소수점을 하나씩 로드하는 것이 비효율적인 Intel 하드웨어의 성능 문제를 해결하고, 원래 패치에서 누락된 `a_offset` 정렬 검증도 수정합니다.
llama.cpp b11265 릴리스에는 Vulkan 백엔드의 Mixture of Experts (MoE) 모델 처리에 대한 수정이 포함되어 있습니다. 이 업데이트는 `mat_mul_id`가 행렬 곱셈 타일을 선택하는 방식을 수정하여 디스패치 중 작업자가 대기 상태가 되는 성능 문제를 해결합니다.
llama.cpp 프로젝트는 Hexagon 백엔드에서 FP32 GELU_ERF 및 GEGLU_ERF 활성화 함수에 대한 지원을 도입하는 버전 b11260을 출시했습니다. 이 업데이트에는 관련 커널 내 레지스터 압력을 줄이는 최적화도 포함되어 있습니다.
llama.cpp 프로젝트는 내장 웹 인터페이스의 service worker 동작에 대한 수정을 포함한 빌드 b11258을 출시했습니다. 이전에는 `--path` 또는 `--no-ui`와 같은 플래그를 사용하면 서버가 `/sw.js`에 대해 404를 반환했기 때문에 브라우저가 인터페이스의 캐시된 버전을 유지했습니다. 이는 service worker 제거를 트리거하지 않습니다.
llama.cpp 프로젝트가 빌드 b11254를 출시했으며, 이는 계산 그래프에서 입력 텐서가 수집되는 방식에 대한 수정을 포함합니다. 이전에는 `graph_inputs`가 그래프 분할 중에 채워져 있어, 서로 다른 입력을 소비하는 배치 간 전환 시 부수적인 백엔드 ID 비교와 스케줄러의 강제 재예약으로 이어지는 파이프라인 병렬화 문제를 유발했습니다.
llama.cpp 서버가 이제 /v1/embeddings 엔드포인트에 대한 유형별 콘텐츠(비전, 오디오, 비디오) 입력을 지원합니다. 이 업데이트는 OpenAI 스타일의 래핑된 콘텐츠 배열을 수락하여 텍스트와 image_url 부분을 함께 처리함으로써 멀티모달 임베딩 요청을 가능하게 합니다.
llama.cpp 프로젝트가 빌드 b11238를 출시하며, 새로운 `ggml_pad_ext` 함수를 통해 통합된 왼쪽 패딩 구현을 도입했습니다. 이 변경은 Parakeet, LFM2-Audio, Granite Speech, Gemma 4와 같은 오디오 인코더에서 사용되었던 이전 방법들을 통합하여 Gemma 4에 대해 비트 단위 일치 임베딩을 보장하고 백엔드 지원을 단순화합니다.
llama.cpp 프로젝트는 ggml-cpu 백엔드에 대한 업데이트를 포함한 빌드 b11232를 출시했습니다. 이번 릴리스는 x86 아키텍처에서 벡터 배수가 아닌 헤드 차원에 대해 타일드 플래시 어텐션을 활성화하는 데 중점을 둡니다.
llama.cpp b11228 릴리스는 Metal 백엔드의 GGML_OP_PAD 연산에서 왼쪽 및 원형 패딩 지원을 도입하여 CPU, CUDA 및 Vulkan 구현과 일치시켰습니다. 이 변경은 순열된 소스의 오른쪽 패딩 문제를 수정하고 다양한 하드웨어 백엔드 간에 일관된 동작을 보장합니다.
llama.cpp 프로젝트는 멀티모달 처리 중 `causal_attn` 플래그 처리를 특별히 대상으로 하는 성능 최적화를 포함하는 빌드 b11227을 출시했습니다.
llama.cpp b11224 릴리스는 KV 캐시와 같은 더 크고 스트라이드 있는 텐서의 슬라이스를 읽을 때 Vulkan 백엔드에서 행렬 곱셈 연산이 잘못된 계산 결과를 생성하는 문제를 해결합니다.
llama.cpp 서버는 이제 Qwen3 및 Qwen3-VL과 같은 인과적 LLM 리랭커에 대해 RANK pooling batch splitting을 허용하여, 기존에 긴 문서 및 멀티모달 리랭킹을 깨뜨리던 제한 사항을 해결했습니다.
llama.cpp b11216 릴리스는 512보다 큰 블록 폭을 지원하는 SYCL 백엔드에서 Fast Walsh-Hadamard Transform (FWHT) 커널을 도입했습니다. 이전에는 더 큰 폭이 O(n^2) 복잡도를 가진 밀집 GEMM으로 폴백되었습니다; 이 변경은 이러한 크기에 대해 O(n log n) 성능을 가능하게 합니다.
llama.cpp 프로젝트가 버전 b11214를 출시했으며, 여기에는 HIP 백엔드에 대한 주요 업데이트가 포함되어 있습니다. 이 릴리스는 dkq > 256일 때 CDNA 아키텍처에서 fattn-mma 커널을 활성화하여 큰 배치 크기에 대한 성능 향상을 목표로 합니다.