L'auteur mesure le chevauchement des sous-espaces de gradient sur quatre modèles pour évaluer la valeur par défaut standard de LoRA qui cible les projections de requête et de valeur. L'analyse indique que cette valeur par défaut peut être sous-optimal lorsque l'objectif est de conserver les capacités précédentes plutôt que de maximiser la précision sur une nouvelle tâche.

  • Sur Llama-3-8B affiné pour le code vers prose, la rétention HumanEval s'est améliorée de 54,1 % avec la valeur par défaut q,v à 75,6 % en utilisant un placement mesuré qui excluait entièrement v_proj.
  • L'ordre de type de l'importance des modules se reproduit sur Llama-3-8B, Mistral-7B, Qwen2.5-7B et TinyLlama-1.1B, avec o_proj en premier et v_proj en dernier ou absent.

Une règle peu coûteuse basée sur le type de module et la profondeur de la couche obtient de bons résultats (AUROC de 0,83 à 0,92) mais sélectionne un ensemble différent de modules, différant d'environ un tiers par rapport à la sélection basée sur le gradient.

L'auteur fournit un notebook Colab et un dépôt GitHub pour reproduire ces mesures, notant que l'implémentation est sous licence AGPL.