Peneliti menyajikan GenRecal, sebuah kerangka kerja distilasi tujuan umum yang mentransfer pengetahuan dari model visi-bahasa besar (VLM) ke rekan yang lebih kecil dan lebih efisien. Metode ini mengatasi tantangan arsitektur VLM heterogen dengan menggunakan Re-calibrator untuk menyelaraskan dan mengadaptasi representasi fitur di antara berbagai jenis model.

  • GenRecal memungkinkan transfer pengetahuan yang efektif antar VLM yang dibangun di atas LLM berbeda dengan tipe token, ukuran kosakata, dan pengurutan indeks yang bervariasi.
  • Eksperimen ekstensif pada berbagai benchmark menantang menunjukkan bahwa GenRecal secara signifikan meningkatkan kinerja baseline.
  • Model kecil yang didistilasi akhirnya mengungguli VLM berskala besar sumber terbuka dan tertutup.

Kerangka kerja ini memungkinkan penyebaran kemampuan visi-bahasa berkinerja tinggi pada perangkat dengan sumber daya terbatas dengan mengatasi keterbatasan arsitektur yang melekat pada metode distilasi sebelumnya.