Les chercheurs proposent la Multiplication Matricielle Réduite (RMM), une méthode d'inférence sans entraînement et adaptative à l'entrée, qui réduit les produits matriciels des Transformers en sélectionnant des tranches informatives le long des dimensions de contraction, sans modifier les poids du modèle. Sous un contrôle simple du ratio de rétention, RMM offre un compromis précision-efficacité fluide et prévisible pour des modèles linguistiques allant de 1B à 70B paramètres.
- La tolérance de réduction dépend de la famille de modèles, de la tâche, du composant et du ratio de rétention, s'améliorant souvent avec l'échelle du modèle.
- RMM reste robuste dans les contextes discriminatifs, de génération autoregressive et à long contexte sous une réduction modérée.
- Le principe s'étend à l'inférence multimodale vision-langage.
- Les ablations mécanistes révèlent que les calculs côté attention sont nettement plus réductibles que les composants MLP.
- Les benchmarks en temps réel sur un NVIDIA A100 montrent des gains de runtime pratiques, particulièrement pour les longueurs de séquence plus longues.
Ces résultats positionnent RMM comme une direction évolutive pour l'optimisation de l'inférence adaptative au niveau de l'entrée.