llama.cpp 프로젝트가 버전 0.4.1을 출시하여 CPU에서 Maple 20B-A1B 삼항 전문가 혼합(MoE) 아키텍처에 대한 지원과 함께 Tencent Hy 4 및 Spark2.5 모델에 대한 미리보기 지원을 도입했습니다.

  • Maple 20B-A1B 삼항 MoE 아키텍처(CPU) 지원을 추가했습니다.
  • Tencent Hy 4(hy_v4) 미리보기 아키텍처 지원을 추가했습니다.
  • Spark2.5 모델 지원을 추가했습니다.
  • ggml을 v0.24.0으로 업데이트하여 새로운 정밀도 제어 API로 백엔드 범위를 확장하고 견고성을 개선했습니다.
  • common_schema 내부 표현으로 리팩토링하여 JSON 스키마 처리를 개선했습니다.
  • 전문화된 채팅 파서를 common/parsers로 분리하고 --log-jsonl을 통해 구조화된 JSONL 로깅을 추가했습니다.
  • DeepSeek2, GLM-MoE 및 관련 모델에 대한 MTP 컨텍스트 KV 캐시 할당 문제를 수정했습니다.
  • 영향을 받는 Qwen/Kimi/GLM 모델에 대한 GDN 정규화를 max에서 rsqrt로 수정했습니다.

이번 릴리스는 새로운 모델 아키텍처를 실행할 수 있게 하며, 교정된 정규화, 캐시 할당 및 서버 자식 프로세스 관리를 통해 안정성을 개선했습니다.