llama.cpp 프로젝트가 빌드 b11351을 출시하며 ggml 백엔드 버퍼 타입 인터페이스에 새로운 메서드를 도입했습니다. 이번 업데이트는 버퍼 할당과 크기 조회에 대한 더 세밀한 제어를 가능하게 하기 위해 `alloc_buffer_n` 및 `get_alloc_size_n`를 추가합니다.

  • `ggml_backend_buft_alloc_buffer_n` 공개 API와 해당 콜백을 `ggml_backend_buffer_type_i`에 추가했습니다.
  • `ggml_tallocr`를 통해 다중 버퍼 분할 및 텐서 할당을 위한 기본 처리를 구현했습니다.
  • 텐서-버퍼 계획 논리를 공유하기 위해 선택적 `get_alloc_size_n` 콜백을 추가했습니다.
  • 기본 구현에서 확인되지 않은 realloc을 std::vector로 대체했습니다.
  • 임시 함수 `ggml_backend_meta_alloc_ctx_tensors_from_buft`를 제거했습니다.

이번 릴리스는 CPU, GPU(CUDA, Vulkan, ROCm, OpenCL), NPU(Hexagon) 및 기타 가속기를 대상으로 macOS, Linux, Windows, Android, openEuler용 바이너리를 제공합니다.