Los investigadores proponen la Multiplicación de Matrices Reducida (RMM), un método de inferencia sin entrenamiento y adaptativo a la entrada que reduce los productos matriciales de Transformers seleccionando fragmentos informativos a lo largo de las dimensiones de contracción, sin modificar los pesos del modelo. Bajo un control simple de la proporción de retención, RMM ofrece una compensación suave y predecible entre precisión y eficiencia en modelos de lenguaje que van desde 1B hasta 70B parámetros.

  • La tolerancia a la reducción depende de la familia de modelos, la tarea, el componente y la proporción de retención, mejorando a menudo con la escala del modelo.
  • RMM permanece robusta en configuraciones discriminativas, generación autoregresiva y contexto largo bajo una reducción moderada.
  • El principio se extiende a la inferencia multimodal de visión y lenguaje.
  • Las ablaciones mecánicas revelan que los cálculos del lado de la atención son sustancialmente más reducibles que los componentes MLP.
  • Los benchmarks en tiempo real en una NVIDIA A100 muestran ganancias prácticas de tiempo de ejecución, especialmente a longitudes de secuencia más largas.

Estos resultados posicionan a RMM como una dirección escalable para la optimización del tiempo de inferencia adaptativa a la entrada.