llama.cpp 버전 0.4.0은 Qwen3.8-Flash-Next 및 NVIDIA Nemotron-3-Puzzle-75B-A9B 모델에 대한 초기 아키텍처 지원을 도입하고, 기반 ggml 라이브러리를 버전 0.23.0으로 업그레이드했습니다.

  • 요청 시 지연 텐서 읽기 및 슬롯별 서버 컨텍스트 제한을 추가했습니다.
  • ggml을 0.23.0으로 업데이트하여 희소 플래시 어텐션 및 Apple RDMA 전송 지원을 포함했습니다.
  • 비디오 입력 옵션, n-gram 히스토리 조회 및 양자화기의 RAM 캡을 도입했습니다.
  • 서버에서 `preserve_reasoning`을 기본적으로 활성화하고 멀티모달 토큰화 도우미를 개선했습니다.

이러한 변경은 모델 호환성을 확장하고 개발자가 메모리 사용량과 서버 리소스 할당에 대해 더 세밀하게 제어할 수 있도록 합니다.