llama.cpp プロジェクトはバージョン b10212 をリリースし、Multi-Token Prediction (MTP) テンソルが実際に使用されている場合にのみロードする変更が含まれています。この更新により、機能はサポートしているが必要としない他のモデルのロード時に MTP テンソルがスキップされるようになります。
- 使用に応じて MTP テンソルを条件付きでロードする。
- 必要のない対応モデルでは MTP のロードをスキップする。
この最適化により、Multi-Token Prediction を利用しないモデルの不要なメモリオーバーヘッドが削減されます。