llama.cpp b11120 は Vulkan の内部シンボルを隠蔽して状態の破損を修正
llama.cpp プロジェクトはバージョン b11120 をリリースし、Vulkan バックエンドの重大なバグを内部シンボルを隠蔽することで修正しました。この変更により、内部シンボルがエクスポートされた際に発生していた重複した dlopen による状態破損の問題を防ぎます。
llama.cpp プロジェクトはバージョン b11120 をリリースし、Vulkan バックエンドの重大なバグを内部シンボルを隠蔽することで修正しました。この変更により、内部シンボルがエクスポートされた際に発生していた重複した dlopen による状態破損の問題を防ぎます。
研究者らは、有界コンテキスト下で長期のコーディングエージェントのコストを最大50%削減するために設計された自動圧縮手法であるCliffCompactionを発表した。この手法は、再表現ではなく切り捨てを通じて圧縮された情報の忠実性を保つことで、Terminal-Benchでのパフォーマンスを維持または向上させ、KernelBenchで最先端の結果を達成している。
研究者らは、数百万トークンを扱うエージェント向けに設計された自動圧縮手法であるCliffCompactionを発表した。これは有界コンテキスト下でコストを最大50%削減する。
llama.cppプロジェクトは、新しいhex-dma機能を含むビルドb11118をリリースしました。この機能は、Hexagon Vector eXtended (HVX) FAマスク処理により適したダイレクトマップDMAキャッシュを導入しています。
Parallel は OpenAI の GPT-6 Astra を AI エージェントインフラストラクチャに統合し、以前のモデルと比較して研究時間とコードコストの両方を 50% 削減することに成功しました。同社は、新モデルによりエージェントが複雑な知識作業を大幅に高速化しながら、高品質な出力を維持できると報告しています。
llama.cpp プロジェクトはビルド b11111 をリリースし、Xe-LPG Plus、Xe2、Xe3 アーキテクチャの split k パス向けに Vulkan ベースの flash attention 最適化カーネルを導入しました。
llama.cppプロジェクトは、ターゲットグラフ内のレイヤー入力テンソルを公開することで、HunyuanOCRモデルとのDFlash推測デコーディングのサポートを追加しました。この変更により、ドラフトモデルが残差ストリームを読み取れるようになり、非推測実行と比較して約0.5のドラフト受容率とバイトレベルで同一のOCR出力を得ながら、画像リクエストを正常に実行できるようになりました。
llama.cpp プロジェクトはバージョン b11104 をリリースし、llama-server コンポーネントが同時に複数のネットワークアドレスにバインドできる新機能をもたらしました。
llama.cpp プロジェクトはビルド b11102 をリリースし、MiMo-V2.6 モデルの変換サポートを導入しました。
llama.cpp プロジェクトは、llama ライブラリに対する重複した find_package 呼び出しを可能にするビルドシステムの修正を含むバージョン b11101 をリリースしました。
Hugging FaceのTransformersライブラリは、基盤となるggmlカーネルを活用してllama.cppに近いパフォーマンスを実現しつつ、GGUF量子化モデルの読み込みをサポートするようになりました。この統合により、開発者は対応ハードウェア上で標準的なPyTorchベースのAPI内で量子化済みチェックポイントを直接実行できます。
llama.cpp プロジェクトはビルド b11100 をリリースし、Muse Glimmer モデルの特定のパーシング問題を解決しました。主な変更点は、このモデルのツール呼び出し実行中に遭遇した最初のパーサーエラーを修正することです。
llama.cpp プロジェクトはバージョン b11097 をリリースし、A8 Q4_0 non-MoE dp4a フォーマット用の OpenCL バイナリカーネルを導入しました。
Jen Wei は、今後の PyTorch Conference の講演に向けて OLMo-core 内で AdamW、Muon、および最新の Dion3 実装をテストしている際に、学習率のデススパイラルに遭遇しました。
あるユーザーは、ilsp/Llama-Krikri-8B-Instructのチェックポイントを使用して、ローカルデプロイ向けの無制限なギリシャ語ネイティブの大規模言語モデルを構築する計画を立てています。提案された計画には、Heretic (heretic-llm) を用いてモデルをアンラーニングし、GGUF Q4_K_M形式に変換し、AMD Ryzen AI MAX+ 395プロセッサとVulkanを搭載したGMKtec EVO-X3で推論を実行することが含まれます。
Together AIは、Canary展開という機能を導入しました。これは、ゲート付きの段階的なステップで、現在のモデルから新しいチェックポイントへライブトラフィックを移行する機能です。このシステムは、ヘルスチェックとオプションのメトリックゲートを走行させてトラフィックを移動する前に実行することで、モデルの切り替えにおける安全策を自動化し、パフォーマンスが低下した場合に自動停止や巻き戻しを可能にします。
研究者らは、エージェントRouterを提案した。これは軽量な分類器であり、すべてのタスクに最先端モデルを使用するのではなく、個々の軌跡のステップを適切なモデルティアにルーティングすることで、マルチステップのエージェントワークフローを最適化する。
llama.cpp b11095 リリースでは、HMX 最適化の GATED_DELTA_NET (GDN) 実装が導入され、Hexagon および Flash Attention カーネルのさまざまな最適化も含まれています。
研究者らは、単一の最先端モデルをすべてのタスクに使用するのではなく、個々の軌跡のステップを適切なモデル階層にルーティングすることで、マルチステップのエージェントワークフローを最適化する軽量な分類器であるAgentRouterを提案している。このシステムは、より小さなモデルでも同等に処理できるサブタスクに対して推論予算の60〜80%を浪費するエンタープライズシステムの非効率性に対処する。
llama.cpp プロジェクトはバージョン b11090 をリリースし、sm_70 タイルのコンパイルエラーの修正が含まれています。このアップデートは、Volta アーキテクチャとの不一致を解消するため、5引数 load_ldmatrix 関数のタイル形状を汎化しました。