llama.cpp 프로젝트가 버전 b10413을 출시했으며, 이 버전은 초안 GGUF 모델 메타데이터에서 추론 사양 유형을 자동으로 감지하는 기능을 도입했습니다.

  • `general.architecture`를 초안 GGUF 헤더에서 읽고 `dflash`, `markov_w1.weight`와 같은 텐서를 매핑하여 spec 유형을 자동 감지합니다. 이는 `draft-dspark` 또는 `draft-dflash`로 매핑됩니다.
  • `--spec-type`을 명시적으로 지정하지 않고 로컬 초안 모델을 로드할 때 추론이 비활성화(type NONE)되는 문제를 수정했습니다.
  • RAII 패턴을 사용하여 spec 유형 감지 로직을 추론 모듈로 이동하고, 자동 감지가 발생할 때 사용자에게 알리기 위한 로깅을 추가했습니다.
  • macOS(Apple Silicon 및 Intel), iOS, Linux(CPU, Vulkan, OpenVINO, SYCL), Android, Windows(CPU, CUDA 12/13, Vulkan, OpenCL, ROCm), openEuler용 바이너리를 제공합니다.

이 변경으로 로컬 초안 모델에 대해 추론이 올바르게 활성화되며, 사양 유형을 수동으로 구성할 필요가 없습니다.