Автор измеряет перекрытие подпространств градиентов для четырёх моделей, чтобы оценить стандартное значение LoRA, ориентированное на проекции запросов и значений. Анализ показывает, что это значение может быть неоптимальным, когда цель заключается в сохранении предыдущих возможностей, а не в максимизации точности на новой задаче.
- На Llama-3-8B, дообученной для преобразования кода в прозу, удержание результатов HumanEval улучшилось с 54.1% при использовании значения q,v по умолчанию до 75.6% при измеренном размещении, полностью исключающем v_proj.
- Порядок типов модулей по важности воспроизводится на Llama-3-8B, Mistral-7B, Qwen2.5-7B и TinyLlama-1.1B: o_proj идёт первым, а v_proj — последним или отсутствует.
- Дешёвое правило, основанное на типе модуля и глубине слоя, показывает хорошие результаты (AUROC от 0.83 до 0.92), но выбирает другой набор модулей, отличающийся примерно на треть от выбора на основе градиентов.
Автор предоставляет блокнот Colab и репозиторий GitHub для воспроизведения этих измерений, отмечая, что реализация лицензирована по AGPL.