llama.cppプロジェクトはバージョンb10594をリリースし、ログの冗長性がLOG_LEVEL_TRACEに設定されていない場合にdevice_infoループをスキップする修正が含まれています。以前はこのループで検出されたデバイスを反復処理してメモリ数を照会する必要があり、GPUコンテキストの作成が必要でした。その結果、データが破棄される場合でも550 MBのVRAMが割り当てられていました。
- この変更により、反復処理の前に冗長性レベルをチェックすることで、不要なGPUリソースの使用を防ぎます。
- macOS (Apple SiliconおよびIntel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、iOS用のバイナリが利用可能です。
- リリースには検証用のUIバイナリとアテステーションも含まれています。
このアップデートは、GPUリソースを使用したくないユーザーが、デバイス情報が必要ない場合にコンテキストの作成やVRAMの割り当てによるオーバーヘッドを回避するのに役立ちます。