llama.cppプロジェクトはビルドb11351をリリースし、ggmlバックエンドバッファ型インターフェースに新しいメソッドを導入しました。この更新により、バッファ割り当てとサイズ照会のより細かな制御が可能になる`alloc_buffer_n`および`get_alloc_size_n`が追加されました。

  • `ggml_backend_buffer_type_i`に`ggml_backend_buft_alloc_buffer_n`の公開APIおよび対応するコールバックを追加しました。
  • `ggml_tallocr`を介してマルチバッファ分割およびテンソル割り当てのデフォルト処理を実装しました。
  • テンソルからバッファへの計画ロジックを共有するためのオプションの`get_alloc_size_n`コールバックを追加しました。
  • デフォルト実装において、チェックされていないreallocをstd::vectorに置き換えました。
  • 一時関数`ggml_backend_meta_alloc_ctx_tensors_from_buft`を削除しました。

このリリースでは、CPU、GPU(CUDA、Vulkan、ROCm、OpenCL)、NPU(Hexagon)、その他のアクセラレータに対応するmacOS、Linux、Windows、Android、openEuler用のバイナリが提供されます。