Pesquisadores apresentam o GenRecal, um framework de destilação de propósito geral que transfere conhecimento de grandes modelos de visão e linguagem (VLM) para contrapartes menores e mais eficientes. O método aborda o desafio das arquiteturas VLM heterogêneas usando um Recalibrator para alinhar e adaptar representações de características entre diferentes tipos de modelos.

  • GenRecal permite transferência de conhecimento eficaz entre VLMs construídos em diferentes LLMs com tipos de token, tamanhos de vocabulário e ordenações de índice variados.
  • Experimentos extensos em múltiplos benchmarks desafiadores mostram que o GenRecal melhora significativamente os desempenhos base.
  • Os modelos pequenos destilados eventualmente superam VLMs grandes de código aberto e fechado.

Este framework permite a implantação de capacidades de visão e linguagem de alto desempenho em dispositivos com recursos limitados, superando as limitações arquiteturais inerentes aos métodos de destilação anteriores.