本記事では、Quantization-Aware Healingを紹介しています。これは、完全精度のオリジナルよりも優れたパフォーマンスを実現する圧縮4ビットモデルを作成するための手法です。
このアプローチは、特定の量子化技術が、ベースラインの非量子化バージョンを超えてモデルの能力を向上できることを示しています。
本記事では、Quantization-Aware Healingを紹介しています。これは、完全精度のオリジナルよりも優れたパフォーマンスを実現する圧縮4ビットモデルを作成するための手法です。
このアプローチは、特定の量子化技術が、ベースラインの非量子化バージョンを超えてモデルの能力を向上できることを示しています。
Metaは、モバイルデバイス上の品質と効率のトレードオフを最適化するために設計された、モバイルデバイス向けのMixture-of-Experts (MoE)言語モデルのコレクションであるMobileMoEをリリースしました。このファミリーには、サブ10億のアクティブパラメータとINT4形式で3 GB未満の重みフットプリントを持つ3つのモデルスケールが含まれています。
著者は Quantization-Aware Healing (QAH) を導入しました。これは、構造的圧縮と量子化中に失われたパフォーマンスを回復するために、非圧縮モデルから直接 4 ビットの学生モデルを蒸留するパイプラインです。GPT-OSS 120B に適用すると、この手法は Hypernova-60B を生成し、9 つのベンチマークのうち 7 つで bfloat16 ソースと同等またはそれ以上のパフォーマンスを発揮しながら、重みメモリを約 4 分の 1 に抑えています。
著者は、構造的に圧縮された4ビット大規模言語モデルの推論およびコーディング能力を回復させる手法であるQuantization-Aware Healing(QAH)を紹介します。標準的な量子化 aware トレーニングが圧縮モデルを再適合させるのとは異なり、QAHは元の非圧縮モデルから4ビット学生モデルを直接蒸留します。
Joakimpalm-Zenは、推論のために提供されるのと同じ量子化されたGGUFウェイトを使用してLoRAアダプターを直接学習するためにXyntetik Runnerを更新し、別個のFP16学習コピーやランタイムの必要性を排除しました。
Liquid AIは、そのLFM2.5ファミリーの3つのモデル向けに、DSparkドラフトモデルのチェックポイントをリリースした。対象となるのはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、およびLFM2.5-8B-A1Bである。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー