llama.cppプロジェクトはビルドb10653をリリースし、モデルローダーにTENSOR_READ_LAZY機能を導入しました。この変更には、TENSOR_GET_ROW_LAZY関数の追加と対応する--tensor-read-lazyコマンドラインフラグが含まれます。
- モデルローダーにTENSOR_READ_LAZYおよびTENSOR_GET_ROW_LAZYを追加。
- 遅延テンソル読み込みを有効にするための--tensor-read-lazy CLIオプションを導入。
- macOS (Apple SiliconおよびIntel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、iOS用のバイナリを提供。
このリリースでは、コアライブラリに新しい遅延読み込み機能が追加され、サポートされているプラットフォーム全体でプリビルドバイナリが配布されています。