llama.cpp 项目发布了版本 b10212,其中包含一项更改:仅在实际使用时才加载 Multi-Token Prediction (MTP) 张量。此更新确保在加载支持该功能但不需要它的其余模型时跳过 MTP 张量。
- 根据使用情况条件性地加载 MTP 张量。
- 在不需要的兼容模型中跳过加载 MTP。
此优化减少了未使用 Multi-Token Prediction 的模型的额外内存开销。
llama.cpp 项目发布了版本 b10212,其中包含一项更改:仅在实际使用时才加载 Multi-Token Prediction (MTP) 张量。此更新确保在加载支持该功能但不需要它的其余模型时跳过 MTP 张量。
此优化减少了未使用 Multi-Token Prediction 的模型的额外内存开销。