llama.cpp プロジェクトはビルド b10593 をリリースし、DeepseekV4 モデルアーキテクチャの重大な問題を解決しました。このアップデートは、複数シーケンス処理中に発生したロールバック失敗を具体的に解消します。

  • 複数シーケンスコンテキストに対する DeepseekV4 のロールバック処理を修正。
  • 一般的なモデル読み込み手順を修正。
  • ステート破損を防ぐため、保留中のロールバック操作を単一使用に変更。
  • フルロード中にキャッシュが特定のシーケンス ID のみクリアされることを保証。
  • 圧縮率に対するアサーションを追加し、グラフトポロジーを静的に設定。

このリリースは、複数のシーケンスを持つ DeepseekV4 モデルを実行するユーザーの安定性を向上させます。また、CPU、CUDA、ROCm、Vulkan を含むさまざまなハードウェアバックエンド上で、macOS、Linux、Windows、Android、iOS 用の更新されたバイナリも提供します。