webgpu 컴포넌트는 MMVQ(Multi-Mode Vector Quantization) 형식에 대한 지원을 추가했습니다. 구체적으로 Q1_0, Q5_0, Q5_1, Q3_K, Q5_K, Q6_K 및 MXFP4입니다.
이 업데이트는 webgpu 환경 내에서 양자화 기능을 확장하기 위해 llama.cpp 저장소의 issue #29를 해결합니다.
webgpu 컴포넌트는 MMVQ(Multi-Mode Vector Quantization) 형식에 대한 지원을 추가했습니다. 구체적으로 Q1_0, Q5_0, Q5_1, Q3_K, Q5_K, Q6_K 및 MXFP4입니다.
이 업데이트는 webgpu 환경 내에서 양자화 기능을 확장하기 위해 llama.cpp 저장소의 issue #29를 해결합니다.
저자는 eqx-zoo를 구축했습니다. 이 라이브러리는 Hugging Face Hub 체크포인트를 평범한 Equinox 모듈로 직접 로드하고 각 모델을 transformers 라이브러리 대비 검증합니다. 현재 프로젝트는 생성을 위해 Llama, Qwen2, Qwen3, Qwen3-MoE를 지원하며, 임베딩을 위해 BERT, RoBERTa, XLM-RoBERTa를 지원합니다.
저자는 AiiStream Q3.6을 출시했으며, 이는 8~16 GB RAM만 있는 Apple Silicon 기기에서 Qwen3.6-35B-A3B 모델을 실행할 수 있게 하는 오픈소스 기술입니다. 라우팅된 전문가를 SSD에 유지하고 조기 로딩 예측을 사용함으로써 이 방법은 MLX 메모리 사용을 약 1.7 GB로 줄이면서 표준 mlx_lm 구현과 바이트 단위로 완전히 동일한 출력을 유지합니다.
llama.cpp 프로젝트는 빌드 b11307을 출시하여 추론 디코딩 중 원래 배치 시퀀스를 보존하기 위해 레이어 입력 순서를 수정했습니다. 이 변경은 마스크되지 않은 NextN 임베딩의 토큰 순서가 올바르게 유지되고 텐서 분할과 호환되도록 보장합니다.
llama.cpp 프로젝트는 ggml 및 gguf 구성 요소 내의 정수 오버플로우 문제를 수정한 빌드 b11301을 출시했습니다. 이 업데이트는 제로 요소 텐서를 처리할 때 잠재적 오류를 방지하기 위해 검증 로직을 개선합니다.
llama.cpp 프로젝트는 CI 파이프라인에서 ThreadSanitizer가 식별한 중대한 동시성 문제를 해결하는 빌드 b11302를 출시했습니다. 이 업데이트는 여러 CPU 스레드가 동일한 메모리 요소에 잘못 작성하여 발생한 희소 어텐션 메커니즘 내의 데이터 경고를 해결합니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침