연구자들은 Transformer의 행렬 곱을 모델 가중치를 수정하지 않고 수축 차원을 따라 정보적인 슬라이스를 선택하여 줄이는 학습 없는 입력 적응형 추론 방법인 축소된 행렬 곱셈(RMM)을 제안합니다. 간단한 유지 비율 제어를 통해 RMM은 1B에서 70B 파라미터에 이르는 언어 모델 전반에 걸쳐 매끄럽고 예측 가능한 정확도-효율성 트레이드오프를 제공합니다.
- 축소 허용도는 모델 패밀리, 작업, 구성 요소 및 유지 비율에 따라 달라지며, 종종 모델 규모가 커질수록 개선됩니다.
- RMM은 적절한 축소 하에서 판별적, 자기회귀 생성 및 긴 컨텍스트 설정 전반에 걸쳐 견고합니다.
- 이 원리는 멀티모달 비전-언어 추론으로 확장됩니다.
- 기계적 아블레이션 연구는 어텐션 측 계산이 MLP 구성 요소보다 훨씬 더 축소 가능함을 보여줍니다.
- NVIDIA A100에서의 실제 시간 벤치마크는 특히 긴 시퀀스 길이에서 실용적인 실행 시간 이점을 보여줍니다.
이러한 결과는 RMM을 입력 적응형 추론 시간 최적화를 위한 확장 가능한 방향으로 위치시킵니다.