webgpu コンポーネントは、MMVQ(Multi-Mode Vector Quantization)形式のサポートを追加しました。具体的には Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K、および MXFP4 です。
この更新により、llama.cpp リポジトリの issue #29 が解決され、webgpu 環境内での量子化機能が拡張されました。
webgpu コンポーネントは、MMVQ(Multi-Mode Vector Quantization)形式のサポートを追加しました。具体的には Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K、および MXFP4 です。
この更新により、llama.cpp リポジトリの issue #29 が解決され、webgpu 環境内での量子化機能が拡張されました。
著者はeqx-zooを構築しました。これは、Hugging Face HubのチェックポイントをプレーンなEquinoxモジュールとして直接読み込み、各モデルをtransformersライブラリに対して検証するライブラリです。現在、生成にはLlama、Qwen2、Qwen3、Qwen3-MoEをサポートし、埋め込みにはBERT、RoBERTa、XLM-RoBERTaをサポートしています。
著者はAiiStream Q3.6をリリースしました。これは、8〜16 GBのRAMを搭載したApple Siliconデバイス上でQwen3.6-35B-A3Bモデルを実行することを可能にするオープンソース技術です。ルーティングされたエキスパートをSSD上に保持し、早期ロード予測を使用することで、この手法はMLXのメモリ使用量を約1.7 GBに削減しつつ、標準的なmlx_lm実装とバイトレベルで完全に一致する出力を維持します。
llama.cpp プロジェクトはビルド b11307 をリリースし、推論デコーディング中に元のバッチシーケンスを保持するためにレイヤー入力の順序を修正しました。この変更により、マスクされていない NextN 埋め込みのトークン順序が正しく維持され、テンソル分割と互換性を持つことが保証されます。
llama.cpp プロジェクトはビルド b11301 をリリースしました。これには、ggml および gguf コンポーネント内の整数オーバーフロー問題の修正が含まれています。このアップデートは、ゼロ要素テンザルの処理時に潜在的なエラーを防ぐための検証ロジックを改善しています。
llama.cpp プロジェクトは、CIパイプラインでThreadSanitizerによって特定された重大な並行性問題を解決するビルド b11302 をリリースしました。この更新では、複数のCPUスレッドが同じメモリ要素に誤って書き込んでいたスパースアテンションメカニズム内のデータ競合を解消しました。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー