llama.cpp b10763에서 preserve_reasoning 기본 활성화
llama.cpp 프로젝트는 `preserve_reasoning` 채팅 템플릿 키워드 인수의 기본 동작을 변경하는 빌드 b10763을 출시했습니다. 서버는 이제 이 kwarg의 유효 상태를 로깅하고 지원되는 템플릿에서 기본적으로 활성화된 경우 경고를 발행합니다.
llama.cpp 프로젝트는 `preserve_reasoning` 채팅 템플릿 키워드 인수의 기본 동작을 변경하는 빌드 b10763을 출시했습니다. 서버는 이제 이 kwarg의 유효 상태를 로깅하고 지원되는 템플릿에서 기본적으로 활성화된 경우 경고를 발행합니다.
llama.cpp 프로젝트는 빌드 b10760을 출시했으며, 이는 추론 중 수치적 불안정성을 방지하기 위해 Qwen3-tts-0.6B 모델에 대한 특정 수정을 포함합니다.
Perplexity는 클라우드 프론티어 모델과 로컬 모델 간에 에이전틱 작업을 분할하고, 민감한 데이터를 처리하기 위해 온디바이스 프라이버시 게이트를 사용하는 맥용 하이브리드 컴퓨팅 기능을 출시했습니다. 이를 통해 사용자는 강력한 클라우드 추론을 활용하면서도 거래 문서나 고객 기록과 같은 개인 파일을 하드웨어에 엄격히 보관할 수 있습니다.
llama.cpp 프로젝트가 빌드 b10751을 출시했으며, 이는 CUDA에서 MoE(Mixture of Experts)의 가중 전문가 축적에 대한 통합 커널을 도입합니다. 이 최적화는 이전의 두 개의 물리적 커널을 실행하던 기본값을 단일 가중 축적 커널로 대체하여 중간 전역 메모리 트래픽을 줄입니다.
llama.cpp 프로젝트는 시퀀스 위치 인덱싱과 n-gram 히스토리 조회를 개선하기 위해 키-밸류 셀 관리를 리팩토링한 빌드 b10750을 출시했습니다.
llama.cpp 프로젝트는 MacBook Neo에 탑재된 Apple A18 Pro 칩을 위해 특별히 빠른 벡터 (fa-vec) 튜닝을 추가하는 새로운 기능을 포함하는 버전 b10742를 출시했습니다.
llama.cpp 프로젝트가 Apple의 M2 Max 하드웨어를 위한 특정 성능 최적화를 포함한 버전 b10739를 출시했습니다. 이 업데이트는 M2 Max의 30개 GPU 코어에 맞춰진 빠른 어텐션 벡터(fa-vec) 튜닝을 도입합니다.
Hugging Face는 Hugging Face Hub에서 최적화된 WebGPU 커널을 로드하고 실행하기 위한 라이브러리인 @huggingface/kernels와 함께 초기 207개 커널 컬렉션을 출시했습니다. 이번 출시에는 사용자의 기기에서 성능과 정확성에 대한 증거를 크라우드소싱하는 브라우저 내 GPU 벤치마킹 스위트인 Fleet도 포함되어 있습니다.
llama.cpp 프로젝트는 M5+ 또는 A19+ 칩이 탑재된 장치를 위해 Metal 4.0 tensor API를 활성화하는 업데이트가 포함된 버전 b10734를 출시했습니다.
Turboderp가 ExLlamaV3에 중요한 업데이트를 출시하여 Mixture of Experts (MoE) 전문가에 대한 CPU 오프로드 기능을 도입했습니다. 이 업데이트에는 새로 출시된 GLM-5.3-Flash 및 Qwen3.8-Flash 모델에 대한 지원도 포함되어 있습니다.
llama.cpp 프로젝트는 b10724 빌드를 출시했으며, 이는 연속된 실행마다 scatter 읽기를 배치 처리하여 비연속 KV 캐시 셀의 복원 성능을 크게 개선했습니다.
llama.cpp 프로젝트는 WebGPU 백엔드에 대한 중요한 수정과 Windows에서의 하드웨어 지원 확장을 포함하는 빌드 b10721을 출시했습니다.
llama.cpp 프로젝트는 CUDA 백엔드에 중요한 업데이트를 포함하는 버전 b10718을 출시했습니다. 가장 주목할 만한 변경은 Mixture of Experts (MOE) 융합을 스펜크티브 디코딩(specdec) 지원을 위해 확장하여, 이전 MOE glu 융합과 topk-router 융합이 한 번에 하나의 토큰만 처리하도록 제한되었던 문제를 해결한 것입니다.
llama.cpp 프로젝트는 DFlash 구현에 대한 주요 최적화를 포함하는 빌드 b10715를 출시했습니다. 이제 DFlash 인코더는 디코딩 중 KV 캐시 주입 프로세스에 직접 융합됩니다.
llama.cpp 프로젝트는 AMD Strix Halo 하드웨어를 타겟팅하는 Vulkan 백엔드를 위한 특정 최적화를 포함하는 빌드 b10714를 출시했습니다. 이 업데이트는 배치 추론 중 성능을 향상시키기 위해 행렬-벡터 곱셈 행 수를 조정합니다.
llama.cpp 프로젝트는 ggml 백엔드에 새로운 기능을 도입하는 빌드 b10706을 출시했습니다. 이 업데이트에는 SWIGLU_CLAMP 추가와 새로운 Vulkan 셰이더 구현이 포함됩니다.
llama.cpp 프로젝트가 키-값(KV) 캐시 처리에 대한 성능 최적화를 포함하는 버전 b10707을 출시했습니다. 이번 업데이트는 모든 가능한 최대 시퀀스를 반복하는 대신 특정 셀 내의 모든 시퀀스가 확인되면 스캔을 중단하도록 `for_each_token_in` 함수를 수정합니다.
llama.cpp 프로젝트는 M2 아키텍처를 위한 빠른 벡터 (fa-vec) 튜닝을 추가하는 풀 리퀘스트를 포함하는 빌드 b10688을 출시했습니다.
llama.cpp 프로젝트는 두 세대 이상의 Adreno GPU에서 행렬 곱셈 성능을 개선하기 위해 OpenCL 백엔드를 업데이트했습니다. 이 변경사항은 기본적으로 xmem F16xF32 GEMM 경로를 채택하고 A7X 세대의 처리를 최적화하여 X2E 세대를 주로 타겟으로 합니다.
llama.cpp 프로젝트는 `--fit` 플래그가 `--fit-target`을 더 정확하게 준수하도록 하는 SYCL 백엔드에 대한 특정 수정 사항을 포함하는 버전 b10684를 출시했습니다.