Los investigadores proponen la Multiplicación de Matrices Reducida (RMM), un método de inferencia sin entrenamiento y adaptativo a la entrada que reduce los productos matriciales de Transformers seleccionando fragmentos informativos a lo largo de las dimensiones de contracción, sin modificar los pesos del modelo. Bajo un control simple de la proporción de retención, RMM ofrece una compensación suave y predecible entre precisión y eficiencia en modelos de lenguaje que van desde 1B hasta 70B parámetros.
- La tolerancia a la reducción depende de la familia de modelos, la tarea, el componente y la proporción de retención, mejorando a menudo con la escala del modelo.
- RMM permanece robusta en configuraciones discriminativas, generación autoregresiva y contexto largo bajo una reducción moderada.
- El principio se extiende a la inferencia multimodal de visión y lenguaje.
- Las ablaciones mecánicas revelan que los cálculos del lado de la atención son sustancialmente más reducibles que los componentes MLP.
- Los benchmarks en tiempo real en una NVIDIA A100 muestran ganancias prácticas de tiempo de ejecución, especialmente a longitudes de secuencia más largas.
Estos resultados posicionan a RMM como una dirección escalable para la optimización del tiempo de inferencia adaptativa a la entrada.