Исследователи представляют GenRecal, универсальную фреймворк дистилляции, который передаёт знания от крупных моделей зрения и языка (VLM) к более мелким и эффективным аналогам. Метод решает проблему гетерогенных архитектур VLM с помощью Перекалибратора для выравнивания и адаптации представлений признаков между различными типами моделей.

  • GenRecal обеспечивает эффективную передачу знаний между VLM, построенными на разных LLM с различными типами токенов, размерами словаря и порядком индексов.
  • Масштабные эксперименты на множестве сложных бенчмарков показывают, что GenRecal значительно улучшает базовые результаты.
  • Дистиллированные мелкие модели в конечном итоге превосходят крупные открытые и закрытые VLM.

Этот фреймворк позволяет разворачивать высокопроизводительные возможности зрения и языка на устройствах с ограниченными ресурсами, преодолевая архитектурные ограничения, присущие предыдущим методам дистилляции.