Исследователи представляют GenRecal, универсальную фреймворк дистилляции, который передаёт знания от крупных моделей зрения и языка (VLM) к более мелким и эффективным аналогам. Метод решает проблему гетерогенных архитектур VLM с помощью Перекалибратора для выравнивания и адаптации представлений признаков между различными типами моделей.
- GenRecal обеспечивает эффективную передачу знаний между VLM, построенными на разных LLM с различными типами токенов, размерами словаря и порядком индексов.
- Масштабные эксперименты на множестве сложных бенчмарков показывают, что GenRecal значительно улучшает базовые результаты.
- Дистиллированные мелкие модели в конечном итоге превосходят крупные открытые и закрытые VLM.
Этот фреймворк позволяет разворачивать высокопроизводительные возможности зрения и языка на устройствах с ограниченными ресурсами, преодолевая архитектурные ограничения, присущие предыдущим методам дистилляции.