llama.cppプロジェクトはバージョンb11195をリリースし、CPUバックエンドにおけるk-quants用のタイル化行列乗算実装を導入しました。この変更により、量子化データを256x256のint8タイルに展開し、マイクロカーネルを使用して結果を計算することで、大規模な行列演算のパフォーマンスが向上します。
- タイル化mul_matは、4096x64 * 64x4096の次元で収支点を迎えるものの、大規模な行列乗算において3〜6倍の速度改善を提供します。
- エラー率は依然として無視できるレベルであり、最大誤差は約1-e04、RMSEは約1-e05です。
- このリリースには、ARMおよびWindowsビルドの修正、Q5_KおよびIQ4_XSベンチマーク向けの統一されたIQPサポート、最適化されたAVX2カーネルが含まれています。
このアップデートにより、サポートされているプラットフォーム全体で数値精度を維持しつつ、大規模な行列演算の推論速度が向上します。