llama.cpp プロジェクトはビルド b10353 をリリースし、CUDA および Metal バックエンドでの ggml_roll 操作の重要なバグに対処しました。以前は、これらのバックエンドがストライド情報を無視していたため、置換された(非連続)ソーステンソルは静かに誤った結果を生成していました。
- 修正により、CUDA および Metal roll カーネルの両方に連続したソースの要件が追加され、既存の GGML_OP_ROPE ガードと一致します。
- この変更により、スケジューラは非連続な入力に対して正しくストライドを処理する CPU 実装にフォールバックすることが保証されます。
- 修正を検証するために置換された test_roll ケースが追加されました。
この更新により、標準以外のメモリレイアウトを持つ ROLL 操作に依存するモデルでのデータ破損が防止されます。