研究人员提出了 GenRecal,这是一种通用的蒸馏框架,可将知识从大型视觉-语言模型(VLM)转移到更小、更高效的对应模型。该方法通过使用重新校准器来对齐和适应不同模型类型之间的特征表示,解决了 VLM 架构异构性的挑战。

  • GenRecal 实现了基于不同 LLM 构建的 VLM 之间有效的知识转移,这些 VLM 具有不同的 token 类型、词汇表大小和索引顺序。
  • 在多个具有挑战性的基准测试上的广泛实验表明,GenRecal 显著提高了基线性能。
  • 蒸馏后的小型模型最终超越了大型开源和闭源 VLM。

该框架通过克服先前蒸馏方法固有的架构限制,使得在资源受限的设备上部署高性能视觉-语言能力成为可能。