Peneliti menyajikan GenRecal, sebuah kerangka kerja distilasi tujuan umum yang mentransfer pengetahuan dari model visi-bahasa besar (VLM) ke rekan yang lebih kecil dan lebih efisien. Metode ini mengatasi tantangan arsitektur VLM heterogen dengan menggunakan Re-calibrator untuk menyelaraskan dan mengadaptasi representasi fitur di antara berbagai jenis model.
- GenRecal memungkinkan transfer pengetahuan yang efektif antar VLM yang dibangun di atas LLM berbeda dengan tipe token, ukuran kosakata, dan pengurutan indeks yang bervariasi.
- Eksperimen ekstensif pada berbagai benchmark menantang menunjukkan bahwa GenRecal secara signifikan meningkatkan kinerja baseline.
- Model kecil yang didistilasi akhirnya mengungguli VLM berskala besar sumber terbuka dan tertutup.
Kerangka kerja ini memungkinkan penyebaran kemampuan visi-bahasa berkinerja tinggi pada perangkat dengan sumber daya terbatas dengan mengatasi keterbatasan arsitektur yang melekat pada metode distilasi sebelumnya.