저자는 쿼리 및 값 투영을 대상으로 하는 표준 LoRA 기본값을 평가하기 위해 네 가지 모델에 걸쳐 그라디언트 부분 공간 중첩을 측정했습니다. 분석 결과, 이 기본값은 새로운 작업에서 정확도를 최대화하는 것이 아니라 이전 능력을 유지하는 것을 목표로 할 때 최적이지 않을 수 있음을 시사합니다.
- 코드에서 문체로 파인튜닝된 Llama-3-8B에서 HumanEval 보존율은 q,v 기본값 사용 시 54.1%에서 v_proj를 완전히 배제한 측정된 배치 방식 사용 시 75.6%로 향상되었습니다.
- 모듈 중요도의 유형 순서는 o_proj가 첫 번째이고 v_proj가 마지막이거나 없는 것을 제외하고 Llama-3-8B, Mistral-7B, Qwen2.5-7B, TinyLlama-1.1B 간에 재현됩니다.
- 모듈 유형과 레이어 깊이를 기반으로 한 저렴한 규칙은 좋은 순위를 기록하지만(AUROC 0.83~0.92), 그라디언트 기반 선택과 약 3분의 일 차이가 나는 서로 다른 모듈 세트를 선택합니다.
저자는 이러한 측정을 재현하기 위한 Colab 노트북과 GitHub 저장소를 제공하며, 구현은 AGPL 라이선스를 따름을 명시했습니다.