Les chercheurs présentent GenRecal, un framework de distillation à usage général qui transfère des connaissances de grands modèles vision-langage (VLM) vers des contreparties plus petites et plus efficaces. La méthode aborde le défi des architectures VLM hétérogènes en utilisant un Recalibrator pour aligner et adapter les représentations de caractéristiques entre différents types de modèles.
- GenRecal permet un transfert de connaissances efficace entre des VLM construits sur différents LLM avec des types de token, des tailles de vocabulaire et des ordres d'index variables.
- Des expériences étendues sur plusieurs benchmarks difficiles montrent que GenRecal améliore significativement les performances de base.
- Les petits modèles distillés finissent par surpasser les VLM à grande échelle open-source et closed-source.
Ce framework permet le déploiement de capacités vision-langage haute performance sur des appareils aux ressources limitées, en surmontant les limitations architecturales inhérentes aux méthodes de distillation précédentes.