연구자들은 GenRecal을 제시했습니다. 이는 대규모 비전-언어 모델(VLM)에서 더 작고 효율적인 대응 모델로 지식을 전달하는 범용 증류 프레임워크입니다. 이 방법은 서로 다른 모델 유형 간에 특징 표현을 정렬하고 적응시키기 위한 Re-calibrator를 사용하여 이종 VLM 아키텍처의 과제를 해결합니다.

  • GenRecal은 서로 다른 LLM 위에 구축되고 다양한 토큰 유형, 어휘 크기 및 인덱스 순서를 가진 VLM 간에 효과적인 지식 전달을 가능하게 합니다.
  • 여러 어려운 벤치마크에 대한 광범위한 실험은 GenRecal이 기준 성능을 크게 향상시킨다는 것을 보여줍니다.
  • 증류된 소규모 모델은 결국 대규모 오픈소스 및 클로즈드소스 VLM을 능가합니다.

이 프레임워크는 이전 증류 방법에 내재된 아키텍처 제한을 극복함으로써 자원 제약이 있는 장치에 고성능 비전-언어 기능을 배포할 수 있게 합니다.