Исследователи предлагают Reduced Matrix Multiplication (RMM), метод вывода без обучения, адаптируемый к входу, который уменьшает произведения матриц в трансформерах за счёт выбора информативных срезов вдоль размерностей свёртки без изменения весов модели. При простом управлении коэффициентом сохранения RMM обеспечивает плавный и предсказуемый компромисс между точностью и эффективностью для языковых моделей от 1B до 70B параметров.
- Допустимое сокращение зависит от семейства моделей, задачи, компонента и коэффициента сохранения, часто улучшаясь с ростом масштаба модели.
- RMM остаётся устойчивым в задачах дискриминации, авторегрессионной генерации и длинного контекста при умеренном сокращении.
- Принцип распространяется на мультимодальный вывод для зрения и языка.
- Механистические аблиационные исследования показывают, что вычисления в механизме внимания значительно более поддаются сокращению, чем компоненты MLP.
- Практические бенчмарки времени выполнения на NVIDIA A100 демонстрируют реальные ускорения, особенно при больших длинах последовательностей.
Эти результаты позиционируют RMM как масштабируемое направление для оптимизации вывода, адаптируемой к входу.