L'architecture PIN v2 introduit une méthode pour pré-sélectionner la taille et la vitesse d'inférence d'un réseau neuronal avant l'entraînement en utilisant le partage de poids. Cette technique force des groupes de cellules à contenir des valeurs identiques, permettant au réseau de maintenir sa largeur tout en réduisant drastiquement le nombre de poids stockés.
- Le partage découple la largeur du réseau du coût de stockage ; un modèle avec 256 unités peut tenir dans un budget de 3 000 nombres qui n'autoriserait normalement qu'une seule unité cachée.
- Dans des tests comparant le partage à l'élagage par magnitude, à la factorisation de faible rang, à la quantification et à la distillation, le partage a remporté quatre budgets de bits sur cinq et était la seule méthode fonctionnelle en dessous de 100 Ko.
- À une compression de 128x, le modèle partagé performe dans une marge de 1,2 points par rapport à la version non compressée.
- L'approche permet un système de coordonnées partagé entre les modèles, permettant à un réseau de base et à une carte linéaire de prédire des variantes pour des combinaisons de tâches invisibles sans réentraînement.
- Un total de 43 000 nombres (base plus carte) peut émettre n'importe laquelle des 120 tâches possibles, tandis que le stockage conventionnel nécessiterait 14 millions de nombres.
Ce cadre permet aux développeurs de spécifier les budgets de stockage et les limites d'inférence en premier, laissant l'architecture du modèle suivre ces contraintes plutôt que de faire du réglage jusqu'à trouver un ajustement.