llama.cppプロジェクトは、Kimi-K3テキストモデルのサポートを追加し、そのハイブリッドKDA(線形)+ MLA(完全)注意機構と、古いKimi-Linear-48Bには存在しない5つの特定のアーキテクチャ機能を実装しました。
- 実装には、クロスレイヤー残差注意、潜在MoE、SwiGLUに取って代わる状況依存活性化、MLA出力ゲート、およびフルランクのKDAゲートが含まれます。
- ルーティングされたエキスパートは、「mxfp4-pack-quantized」形式を使用して圧縮テンソルとして提供され、これはggmlのMXFP4とビット互換性があり、量子化解除なしでロスレスな再パックを可能にします。
- 新しいチャットテンプレートは、推論、コンテンツ、およびツール呼び出しに対するKimi-K3のXTML風タグ形式を処理し、特定のメッセージ区切り文字とトークンレベルのスパン分割を含みます。
- コンバーターは型エラーを修正し、LLAMA_MAX_EXPERTSを512から1024に増やします。また、モデルセーバーは現在、ラウンドトリップ忠実度を保持するためにkda_gate_lower_boundパラメータを正しく出力します。
この更新により、ユーザーはMoonshotの参照実装および実際の生成データとの検証されたエンドツーエンドの正確性に対してKimi-K3をローカルで実行できるようになります。