llama.cpp プロジェクトはバージョン b10705 をリリースしました。これには TENSOR_READ_LAZY 処理メカニズムの改善が含まれています。この更新により、遅延設定が有効な場合に CPU で遅延テンソルが強制的に読み込まれます。

  • llama.cpp での TENSOR_READ_LAZY 処理の改善
  • 遅延モードがアクティブな場合に CPU で遅延テンソルの動作を強制

このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO を含むさまざまなハードウェアバックエンド向けに、macOS、Linux、Windows、Android、iOS 用の更新されたバイナリが提供されています。