llama.cpp v0.6.0은 혼합 토큰 및 임베딩 입력을 위한 새로운 llama_batch_ext 확장 배치 API를 도입하며, GLM-5.3-Flash 320B 하이브리드 모델과 Clef 의사결정 모델을 지원합니다.
- 새로운 llama_batch_ext API는 MTP 및 deepstack 모델에 대한 토큰별 상태 임베딩을 지원합니다.
- Qwen4Exp는 MTP 추론 디코딩을 통해 고품질 지원을 제공하며, DGX Spark에서 약 1.5x의 디코딩 속도 향상을 제공합니다.
- 새로운 /v1/systemone 서버 API는 laya, julia-1, lev, openjev, kev 등 다섯 가지 의사결정 모델을 지원합니다.
- Metal은 F16 KV 및 MMA 행렬 곱 연산에 대한 tensor-API 플래시 어텐션 커널을 추가하여 Apple GPU에서 최대 3배 빠른 성능을 제공합니다.
- Web UI는 Hugging Face Hub 데이터 레이어와 모델 다운로드 파이프라인으로 전면 개편되었습니다.
이번 릴리스는 llama.cpp의 다중 모달 처리, 추론 디코딩 성능 및 의사결정 모델 통합 기능을 확장합니다.