El autor mide la superposición del subespacio de gradientes en cuatro modelos para evaluar el valor predeterminado estándar de LoRA que apunta a las proyecciones de consulta y valor. El análisis indica que este valor predeterminado puede ser subóptimo cuando el objetivo es retener capacidades previas en lugar de maximizar la precisión en una nueva tarea.

  • En Llama-3-8B ajustado finamente para código-a-prosa, la retención en HumanEval mejoró del 54.1% con el valor predeterminado q,v al 75.6% utilizando una colocación medida que excluyó v_proj por completo.
  • El orden de importancia de los tipos de módulo se reproduce en Llama-3-8B, Mistral-7B, Qwen2.5-7B y TinyLlama-1.1B, con o_proj primero y v_proj último o ausente.
  • Una regla económica basada en el tipo de módulo y la profundidad de la capa tiene un buen rendimiento (AUROC 0.83 a 0.92) pero selecciona un conjunto diferente de módulos, difiriendo aproximadamente en un tercio de la selección basada en gradientes.

El autor proporciona un cuaderno de Colab y un repositorio de GitHub para reproducir estas mediciones, señalando que la implementación está licenciada bajo AGPL.