MCP Python SDK v1.30.0 が HTTP リダイレクトを制限し、アイドルセッションの有効期限と発行者の検証を追加
Model Context Protocol (MCP) の Python SDK がバージョン 1.30.0 をリリースしました。これは 1.x ライン向けのメンテナンスアップデートで、より厳格なセキュリティデフォルトと新しい設定オプションを導入しています。
Model Context Protocol (MCP) の Python SDK がバージョン 1.30.0 をリリースしました。これは 1.x ライン向けのメンテナンスアップデートで、より厳格なセキュリティデフォルトと新しい設定オプションを導入しています。
Nvidiaは、機械学習プラットフォームであるHugging Faceを129億ドルの取引で買収する意向を正式に発表した。
Open TTS Leaderboardは、Text-to-Speech (TTS) 評価における断片化と標準化の欠如に対処するため、遅くアリーナベースの人間による好みスコアに依存するのではなく、客観的な指標を使用してリリースされました。Qwen3 ASRおよびWavLM埋め込みを用いて、明瞭性、速度、話者類似性の各モデルを評価します。
llama.cppプロジェクトは、GLM-5.3-Flash (GLM5-Next) モデルアーキテクチャの初期サポートを追加しました。これには、ハイブリッドインデックスメモリへの移行と早期のMulti-Token Prediction (MTP) 機能が含まれます。
llama.cppプロジェクトは、Vulkanの最適化を含むビルドb11266をリリースしました。この最適化では、2アラインメントされたF32 A行列を一度に2要素ずつ読み込みます。この変更は、浮動小数点数を一つずつ読み込むのが非効率なIntelハードウェアでのパフォーマンス問題を解決し、元のパッチで`a_offset`の整列に関する検証が欠落していた点も修正します。
llama.cpp b11265 リリースには、Vulkan バックエンドによる Mixture of Experts (MoE) モデルの処理に関する修正が含まれています。この更新では、`mat_mul_id` が行列乗算タイルを選択する方法が修正され、ディスパッチ中にワーカーがアイドル状態になるパフォーマンスの問題が解消されました。
H社は、デスクトップ、Web、Android、API環境でクリック、入力、コード記述、ツール呼び出しを行うために設計された汎用コンピュータ操作ビジョン言語モデルのファミリーであるHolo4をリリースした。今回のリリースには2つのモデルサイズが含まれる:Holo4 27B(デンス)とHolo4 35B-A3B(エキスパート混合、アクティブパラメータ3B)。どちらも256Kのコンテキストウィンドウをサポートする。
IQuestは、エージェント型コーディング、推論、マルチステップツール使用のために設計されたMixture-of-Experts (MoE)モデルであるIQuest-Q1をリリースしました。 このモデルは約3200億の総パラメータを持ち、トークンあたり約150億のパラメータが活性化されます。 Hugging Faceで利用可能です。
llama.cpp プロジェクトはビルド b11238 をリリースし、新しい `ggml_pad_ext` 関数を通じて統一された左パディング実装を導入しました。この変更により、Parakeet、LFM2-Audio、Granite Speech、Gemma 4 などの音声エンコーダーで以前使用されていた方法が統合され、Gemma 4 の埋め込みがビット単位で同一になることが保証されるとともに、バックエンドのサポートが簡素化されました。
llama.cpp プロジェクトはビルド b11232 をリリースし、ggml-cpu バックエンドの更新が含まれています。今回のリリースは、x86 アーキテクチャ上でベクトル倍数ではないヘッド次元に対してタイルドフラッシュアテンションを有効化することに焦点を当てています。
llama.cpp b11228 リリースは、Metal バックエンドの GGML_OP_PAD 操作において左側および円形パディングのサポートを導入し、CPU、CUDA、Vulkan の実装と整合させました。この変更により、置換されたソースの右側パディングの問題が修正され、異なるハードウェアバックエンド間で一貫した動作が保証されます。
llama.cpp b11224 リリースは、KV キャッシュなどのより大きくストライド付きのテンソルのスライスを読み取る際に、Vulkan バックエンドで行列乗算演算が誤った計算結果を生じる問題を解決します。
9月27日、Claude Opus 5と3BモデルのTetsuは、パブリックリポジトリにある6つの個別の継続的インテグレーション(CI)チェックを特定した。これらは本来測定すべきものを検証せずにグリーンまたは合格と報告していた。問題は、古いダイジェストのために有効な再起動を拒否するデプロイメントゲートから、無意味なパフォーマンス差を受け入れる空虚な閾値を持つタイミングベンチマークまで多岐にわたった。
llama.cpp サーバーは、Qwen3 や Qwen3-VL などの因果 LLM リランカーに対して RANK pooling batch splitting を許可するようになり、長いドキュメントやマルチモーダルなリランキングを壊していた以前の制限が解消されました。
llama.cpp b11216リリースでは、512より大きいブロック幅をサポートするSYCLバックエンドにFast Walsh-Hadamard Transform (FWHT) カーネルが導入されました。以前は、より大きな幅はO(n^2)の複雑さを持つ密なGEMMにフォールバックしていましたが、この変更によりこれらのサイズでO(n log n)のパフォーマンスが可能になります。
llama.cpp プロジェクトはバージョン b11214 をリリースしました。これには HIP バックエンドへの重要な更新が含まれています。このリリースでは、dkq > 256 の場合、CDNA アーキテクチャ上で fattn-mma カーネルが有効化され、大きなバッチサイズ向けの性能向上を特に狙っています。
llama.cpp プロジェクトはビルド b11207 をリリースし、Hexagon バックエンドで Q4_0 と Q8_0 の GET_ROWS 操作のタイルサポートを導入しました。このアップデートには、マクロ、レジスタスパイル、DMA パイプラインの修正に加え、カーネル選択ロジックの改善とベクトル化の再有効化が含まれています。
llama.cppプロジェクトはバージョンb11195をリリースし、CPUバックエンドにおけるk-quants用のタイル化行列乗算実装を導入しました。この変更により、量子化データを256x256のint8タイルに展開し、マイクロカーネルを使用して結果を計算することで、大規模な行列演算のパフォーマンスが向上します。
llama.cppプロジェクトはビルドb11184をリリースし、ブロック幅が512を超えるMetalバックエンド用の新しい高速ウォールシュ・アダマール変換(FWHT)カーネルを導入しました。以前、Metal FWHTの実装は64から512の幅に制限されていました。
llama.cpp プロジェクトは、MUSA (MTT S5000) の演算子失敗およびビルド問題に対する修正をリリースしました。これは PH1 アーキテクチャを対象としています。このアップデートは、このハードウェアで誤った結果やタイムアウトを引き起こしていた重大なバグを解決します。