llama.cpp プロジェクトはバージョン b11047 をリリースし、in-place キーによって引き起こされた CUB argsort の破損に対する重要な修正を含んでいます。この問題は、`argsort_f32_i32_cuda_cub` がエイリアス化された入力および出力キーバッファで `DeviceRadixSort::SortPairs` を呼び出したため発生し、CUB の内部ダブルバッファリングの ping-pong がパス中に自身の入力を上書きしていました。
このバグにより、特に CUDA 12.5 および CCCL 2.x を搭載した Maxwell GPU で、壊れた順列と断続的なゴミインデックスが発生し、その後ダウンストリームの `get_rows` 操作で境界外アクセスがトリガーされました。修正により、すべての6つの呼び出しサイト(プレーンおよびセグメント化、昇順および降順、サイズクエリおよび実行)が異なる keys-out バッファを使用することが保証されます。
リリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、および OpenCL バックエンド向けに、macOS、Linux、Android、Windows、および openEuler 用のバイナリが提供されています。