vLLM プロジェクトはバージョン 0.29.0 をリリースし、密集プレフィックスキャッシュに関するコアなバグ修正を含んでいます。
- このアップデートは、密集プレフィックスキャッシュのデフォルト設定をハイブリッドモデルに特に適用します。
vLLM プロジェクトはバージョン 0.29.0 をリリースし、密集プレフィックスキャッシュに関するコアなバグ修正を含んでいます。
llama.cppプロジェクトは、PowerVR GPUにおける重大な安定性問題を解決するバージョンb10891をリリースしました。このアップデートでは、Vulkanバックエンドが量子化解除された行列-ベクトル乗算(dmmv)演算に対して共有メモリへのリダクションにフォールバックするように変更されました。
DeepSeek AIは、100万トークンのコンテキストウィンドウと、グローバルキャッシュのフットプリントをトークンあたり890バイトに削減するFP4 KVキャッシュを備えたマルチモーダルMixture-of-ExpertsモデルであるDeepSeek-V4.1-Flashをリリースしました。このモデルは、因果的なエンコーダ・デコーダアーキテクチャとCompressed Sparse Attention 2 (CSA2) を活用し、パフォーマンスを維持しながらメモリ要件を大幅に削減しています。
llama.cpp プロジェクトはビルド b10889 をリリースしました。これには、インデクサーで使用されないため V キャッシュの割り当てを回避するメモリ最適化が含まれています。
llama.cppプロジェクトは、VulkanバックエンドでGPUプロファイラー用のコマンドバッファデバッグラベルを追加する新機能を含むビルドb10888をリリースしました。
llama.cpp プロジェクトはビルド b10886 をリリースし、s390x アーキテクチャ向けの Q1_0 ベクトル組み込みサポートを導入しました。このアップデートには `ggml_vec_dot_q1_0_q8_0` の実装が含まれ、新しい機能を反映するためにドキュメントが更新されました。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー