llama.cpp b11120 は Vulkan の内部シンボルを隠蔽して状態の破損を修正
llama.cpp プロジェクトはバージョン b11120 をリリースし、Vulkan バックエンドの重大なバグを内部シンボルを隠蔽することで修正しました。この変更により、内部シンボルがエクスポートされた際に発生していた重複した dlopen による状態破損の問題を防ぎます。
llama.cpp プロジェクトはバージョン b11120 をリリースし、Vulkan バックエンドの重大なバグを内部シンボルを隠蔽することで修正しました。この変更により、内部シンボルがエクスポートされた際に発生していた重複した dlopen による状態破損の問題を防ぎます。
llama.cppプロジェクトは、新しいhex-dma機能を含むビルドb11118をリリースしました。この機能は、Hexagon Vector eXtended (HVX) FAマスク処理により適したダイレクトマップDMAキャッシュを導入しています。
llama.cppプロジェクトは、ターゲットグラフ内のレイヤー入力テンソルを公開することで、HunyuanOCRモデルとのDFlash推測デコーディングのサポートを追加しました。この変更により、ドラフトモデルが残差ストリームを読み取れるようになり、非推測実行と比較して約0.5のドラフト受容率とバイトレベルで同一のOCR出力を得ながら、画像リクエストを正常に実行できるようになりました。
llama.cpp プロジェクトはバージョン b11104 をリリースし、llama-server コンポーネントが同時に複数のネットワークアドレスにバインドできる新機能をもたらしました。
llama.cpp プロジェクトはビルド b11102 をリリースし、MiMo-V2.6 モデルの変換サポートを導入しました。
Hugging FaceのTransformersライブラリは、基盤となるggmlカーネルを活用してllama.cppに近いパフォーマンスを実現しつつ、GGUF量子化モデルの読み込みをサポートするようになりました。この統合により、開発者は対応ハードウェア上で標準的なPyTorchベースのAPI内で量子化済みチェックポイントを直接実行できます。
oMLXのクリエイターかつメンテナーであるJun Kimが、MLXコミュニティをサポートするためにHugging Faceに入社しました。この動きは、サイドプロジェクトから完全に維持・資金提供されたイニシアチブへと移行することで、オープンソースプロジェクトに安定性とより迅速な開発を提供することを目指しています。
あるユーザーは、ilsp/Llama-Krikri-8B-Instructのチェックポイントを使用して、ローカルデプロイ向けの無制限なギリシャ語ネイティブの大規模言語モデルを構築する計画を立てています。提案された計画には、Heretic (heretic-llm) を用いてモデルをアンラーニングし、GGUF Q4_K_M形式に変換し、AMD Ryzen AI MAX+ 395プロセッサとVulkanを搭載したGMKtec EVO-X3で推論を実行することが含まれます。
llama.cpp プロジェクトはバージョン b11090 をリリースし、sm_70 タイルのコンパイルエラーの修正が含まれています。このアップデートは、Volta アーキテクチャとの不一致を解消するため、5引数 load_ldmatrix 関数のタイル形状を汎化しました。
llama.cpp プロジェクトは、`test-llama-archs` テストインフラストラクチャのいくつかの更新を含むビルド b11081 をリリースしました。主な変更点には、テンソルデータの標準偏差を構成可能にすること、使用例の拡大、およびアーキテクチャ正規表現パターンのサポート追加が含まれます。
llama.cpp プロジェクトはビルド b11074 をリリースし、JSON enum の処理に関する修正が含まれています。このアップデートでは、enum 値に対する common_json_value のサポートが追加され、enum コンストラクタが基底型のコンストラクタに委譲されることでコードが簡素化されました。
llama.cpp プロジェクトはビルド b11067 をリリースし、WebGPU バックエンドのために融合された GDN + コピー操作を導入しました。
llama.cpp プロジェクトはビルド b11060 をリリースしました。これには、時間ステップ射影入力が連続であることを保証するための Mamba モデルの修正が含まれています。この変更により、Mamba 実装内のメモリレイアウトの問題が解消されました。
llama.cppプロジェクトは、Qualcomm Hexagon DSP上でTOP_K演算子のサポートを追加したバージョンb11054をリリースしました。このアップデートには、単一行処理の最適化と行パーティショニングの修正が含まれています。
llama.cpp プロジェクトはバージョン b11055 をリリースし、Hexagon DSP での GEGLU_QUICK 活性化関数のサポートを導入しました。
llama.cpp プロジェクトはバージョン b11053 をリリースし、サーバーの起動ログメッセージに特定の改善を含めました。この変更により、暗号化されたマーカーを明示的なソースタグに置き換えることで、モデルがどのように読み込まれるかの可視性が向上します。
llama.cppプロジェクトはビルドb11048をリリースし、qwen4expで使用される新しいDSV4 HC演算バリアントのサポートを導入しました。このアップデートには、要素ごとのシグモイドゲートを持つhc_preと恒等混合を持つhc_postの具体的な実装が含まれます。
NVIDIA版のCelestium CAREが完成し、GTXおよびRTXグラフィックカード向けのプロフェッショナルツールとして提供されています。VRAMクリーン、自動クリーニングスケジュール、完全なテレメトリモニタリングなどの機能を提供するためにNVMLを利用しています。
llama.cpp プロジェクトはバージョン b11046 をリリースし、`flash_attn_f32_f16_bin` カーネルの OpenCL サポートを導入しました。このアップデートには、OpenCL デバイス上の Flash Attention 用のガード付きプリフィル機能も含まれています。
llama.cpp プロジェクトはバージョン b11042 をリリースし、A8 Q6_K 非 MoE モデル用の新しい OpenCL バイナリカーネルを導入しました。このアップデートには、OpenCL バックエンド内のレイアウト互換性の修正も含まれています。