Peneliti mengusulkan Masters, sebuah kerangka pembelajaran penguatan progresif-masking untuk mendistilasi model visi-bahasa skala besar menjadi versi kompak yang cocok untuk penyebaran di tepi. Metode ini mengatasi ketidakstabilan yang disebabkan oleh kesenjangan ukuran antara model guru dan siswa.

  • Masters memasker bobot non-dominan dari guru untuk mengurangi kompleksitas, lalu secara progresif memulihkan kapasitas selama pelatihan untuk memungkinkan pembelajaran yang lebih lancar.
  • Ini mengintegrasikan tahap RL offline menggunakan respons pra-digenerasi dari guru termasker, menghindari biaya komputasi paradigma pikirkan-jawab online.
  • Kerangka kerja ini menggunakan dua hadiah pelengkap: hadiah akurasi untuk kebenaran respons dan hadiah distilasi yang mengukur kemudahan transfer.

Pendekatan ini memungkinkan siswa mencapai kinerja yang kuat dengan memanfaatkan panduan yang kaya namun efisien tanpa memerlukan proses generasi respons yang panjang.