作者通过测量四个模型中的梯度子空间重叠情况,评估了将查询和值投影作为标准 LoRA 默认目标的合理性。分析表明,当目标是保留先前能力而非最大化新任务的准确率时,该默认设置可能并非最优。
- 在对 Llama-3-8B 进行代码到散文微调时,HumanEval 的保留率从使用 q,v 默认设置的 54.1% 提升至采用排除 v_proj 的测量放置策略后的 75.6%。
- 模块重要性的类型排序在 Llama-3-8B、Mistral-7B、Qwen2.5-7B 和 TinyLlama-1.1B 中重现,其中 o_proj 排在首位,v_proj 排在末尾或不存在。
- 基于模块类型和层深度的廉价规则表现良好(AUROC 为 0.83 至 0.92),但选择了不同的模块集合,与基于梯度的选择结果相差约三分之一。
作者提供了用于复现这些测量的 Colab 笔记本和 GitHub 仓库,并指出该实现采用 AGPL 许可证。