本記事では、Quantization-Aware Healingを紹介しています。これは、完全精度のオリジナルよりも優れたパフォーマンスを実現する圧縮4ビットモデルを作成するための手法です。

このアプローチは、特定の量子化技術が、ベースラインの非量子化バージョンを超えてモデルの能力を向上できることを示しています。