vLLM 프로젝트는 밀집 접두사 캐시에 대한 핵심 버그 수정을 포함하는 버전 0.29.0을 출시했습니다.
- 업데이트는 하이브리드 모델에 밀집 접두사 캐시 기본 설정을 특별히 적용합니다.
vLLM 프로젝트는 밀집 접두사 캐시에 대한 핵심 버그 수정을 포함하는 버전 0.29.0을 출시했습니다.
llama.cpp 프로젝트는 PowerVR GPU에서 치명적인 안정성 문제를 해결한 버전 b10891을 출시했습니다. 이 업데이트는 Vulkan 백엔드를 수정하여 dequantized matrix-vector multiplication(dmmv) 연산에 공유 메모리 감소를 폴백하도록 합니다.
DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.
llama.cpp 프로젝트는 인덱서에서 사용되지 않기 때문에 V 캐시를 할당하지 않도록 하는 메모리 최적화가 포함된 빌드 b10889를 출시했습니다.
llama.cpp 프로젝트는 Vulkan 백엔드에서 GPU 프로파일러를 위한 명령 버퍼 디버그 레이블을 추가하는 새로운 기능을 포함하는 빌드 b10888을 출시했습니다.
llama.cpp 프로젝트는 s390x 아키텍처에 대한 Q1_0 벡터 내장 지원을 도입한 빌드 b10886을 출시했습니다. 이 업데이트에는 `ggml_vec_dot_q1_0_q8_0` 구현이 포함되어 있으며, 새로운 기능을 반영하기 위해 문서가 업데이트되었습니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침