출처 · llama.cpp
github llama.cpp · 19시간 전 · 조회수 2회

llama.cpp b11266는 Intel에서 Vulkan용 F32 A 행렬을 2개씩 로드합니다

llama.cpp 프로젝트는 Vulkan 최적화를 포함하는 빌드 b11266를 출시했으며, 이는 2-정렬된 경우 F32 A 행렬을 한 번에 두 요소씩 로드합니다. 이 변경은 부동소수점을 하나씩 로드하는 것이 비효율적인 Intel 하드웨어의 성능 문제를 해결하고, 원래 패치에서 누락된 `a_offset` 정렬 검증도 수정합니다.

github llama.cpp · 1일 전 · 조회수 1회

llama.cpp b11258은 UI가 제공되지 않을 때 내장 UI service worker를 제거합니다

llama.cpp 프로젝트는 내장 웹 인터페이스의 service worker 동작에 대한 수정을 포함한 빌드 b11258을 출시했습니다. 이전에는 `--path` 또는 `--no-ui`와 같은 플래그를 사용하면 서버가 `/sw.js`에 대해 404를 반환했기 때문에 브라우저가 인터페이스의 캐시된 버전을 유지했습니다. 이는 service worker 제거를 트리거하지 않습니다.

github llama.cpp · 1일 전 · 조회수 7회

llama.cpp b11254 파이프라인 병렬화를 위한 그래프 입력 수집 수정

llama.cpp 프로젝트가 빌드 b11254를 출시했으며, 이는 계산 그래프에서 입력 텐서가 수집되는 방식에 대한 수정을 포함합니다. 이전에는 `graph_inputs`가 그래프 분할 중에 채워져 있어, 서로 다른 입력을 소비하는 배치 간 전환 시 부수적인 백엔드 ID 비교와 스케줄러의 강제 재예약으로 이어지는 파이프라인 병렬화 문제를 유발했습니다.

github llama.cpp · 2일 전 · 조회수 4회

llama.cpp b11238는 왼쪽 패딩을 위해 ggml_pad_ext를 추가하고 DFlash2 탭을 건너뜀

llama.cpp 프로젝트가 빌드 b11238를 출시하며, 새로운 `ggml_pad_ext` 함수를 통해 통합된 왼쪽 패딩 구현을 도입했습니다. 이 변경은 Parakeet, LFM2-Audio, Granite Speech, Gemma 4와 같은 오디오 인코더에서 사용되었던 이전 방법들을 통합하여 Gemma 4에 대해 비트 단위 일치 임베딩을 보장하고 백엔드 지원을 단순화합니다.