llama.cpp 0.3.0은 새로운 DSA-ISWA KV 캐시 유형을 통해 dots3-note 다중모달 모델을 지원하고, GLM-4.5-Air에 대한 멀티 토큰 예측(MTP) 지원을 도입합니다. 이번 릴리스는 DeepSeek 4용 텐서 분할 기능을 추가하고 여러 시퀀스 롤백 문제를 수정했습니다.
- ggml이 v0.22.0으로 업데이트되어 메타-백엔드와 병렬 컴파일을 지원하는 per-op Metal 커널에 텐서 분할 지원이 추가되었습니다.
- mtmd가 dots3-note 비전/오디오 지원, ffmpeg를 통한 WebP 디코딩, 그리고 Pillow 수준의 정확한 리사이즈 알고리즘을 얻었습니다.
- DeepSeek 4는 `-sm tensor` 플래그를 통해 텐서 분할 모드를 받으며, 여러 시퀀스 관련 롤백 문제가 수정되었습니다.
- 서버에 `LLAMA_SERVER_SLOTS_N_DIFF` 디버그 노브가 추가되었고, 웹 UI에는 탭 기반 채팅 내비게이션이 도입되었습니다.
이번 업데이트는 llama.cpp의 다중모달 기능을 확장하고 DeepSeek 4 및 GLM-4.5-Air와 같은 특정 모델 아키텍처에 대한 성능과 안정성을 개선했습니다.