Исследователи предлагают Reduced Matrix Multiplication (RMM), метод вывода без обучения, адаптируемый к входу, который уменьшает произведения матриц в трансформерах за счёт выбора информативных срезов вдоль размерностей свёртки без изменения весов модели. При простом управлении коэффициентом сохранения RMM обеспечивает плавный и предсказуемый компромисс между точностью и эффективностью для языковых моделей от 1B до 70B параметров.

  • Допустимое сокращение зависит от семейства моделей, задачи, компонента и коэффициента сохранения, часто улучшаясь с ростом масштаба модели.
  • RMM остаётся устойчивым в задачах дискриминации, авторегрессионной генерации и длинного контекста при умеренном сокращении.
  • Принцип распространяется на мультимодальный вывод для зрения и языка.
  • Механистические аблиационные исследования показывают, что вычисления в механизме внимания значительно более поддаются сокращению, чем компоненты MLP.
  • Практические бенчмарки времени выполнения на NVIDIA A100 демонстрируют реальные ускорения, особенно при больших длинах последовательностей.

Эти результаты позиционируют RMM как масштабируемое направление для оптимизации вывода, адаптируемой к входу.