Pesquisadores propõem a Multiplicação de Matrizes Reduzida (RMM), um método de inferência adaptativo à entrada e sem treinamento que reduz os produtos matriciais dos Transformers ao selecionar fatias informativas ao longo das dimensões de contração, sem modificar os pesos do modelo. Sob um controle simples da taxa de retenção, o RMM oferece uma troca suave e previsível entre precisão e eficiência em modelos de linguagem que variam de 1B a 70B parâmetros.
- A tolerância à redução depende da família do modelo, da tarefa, do componente e da taxa de retenção, frequentemente melhorando com o aumento da escala do modelo.
- O RMM permanece robusto em configurações discriminativas, geração autoregressiva e contexto longo sob redução moderada.
- O princípio se estende à inferência multimodal de visão e linguagem.
- Ablações mecanísticas revelam que os cálculos do lado da atenção são substancialmente mais redutíveis do que os componentes MLP.
- Benchmarks de tempo real em uma NVIDIA A100 mostram ganhos práticos de tempo de execução, especialmente em comprimentos de sequência maiores.
Esses resultados posicionam o RMM como uma direção escalável para otimização de inferência adaptativa à entrada no momento da inferência.