Para peneliti mengusulkan Pengurangan Perkalian Matriks (RMM), metode inferensi adaptif-input tanpa pelatihan yang mengurangi produk matriks Transformer dengan memilih irisan informatif sepanjang dimensi kontraksi tanpa memodifikasi bobot model. Di bawah kontrol rasio retensi yang sederhana, RMM memberikan trade-off akurasi-efisiensi yang halus dan dapat diprediksi di seluruh model bahasa mulai dari 1B hingga 70B parameter.

  • Toleransi reduksi bergantung pada keluarga model, tugas, komponen, dan rasio retensi, sering kali meningkat seiring skala model.
  • RMM tetap robust di berbagai pengaturan diskriminatif, generasi autoregresif, dan konteks panjang di bawah reduksi moderat.
  • Prinsip ini meluas ke inferensi visi-bahasa multimodal.
  • Ablasi mekanistik mengungkapkan bahwa komputasi sisi perhatian jauh lebih dapat direduksi daripada komponen MLP.
  • Benchmark wall-clock pada NVIDIA A100 menunjukkan peningkatan runtime praktis, terutama pada panjang urutan yang lebih lama.

Hasil-hasil ini menempatkan RMM sebagai arah skalabel untuk optimisasi waktu inferensi adaptif-input.