Pesquisadores apresentam o GenRecal, um framework de destilação de propósito geral que transfere conhecimento de grandes modelos de visão e linguagem (VLM) para contrapartes menores e mais eficientes. O método aborda o desafio das arquiteturas VLM heterogêneas usando um Recalibrator para alinhar e adaptar representações de características entre diferentes tipos de modelos.
- GenRecal permite transferência de conhecimento eficaz entre VLMs construídos em diferentes LLMs com tipos de token, tamanhos de vocabulário e ordenações de índice variados.
- Experimentos extensos em múltiplos benchmarks desafiadores mostram que o GenRecal melhora significativamente os desempenhos base.
- Os modelos pequenos destilados eventualmente superam VLMs grandes de código aberto e fechado.
Este framework permite a implantação de capacidades de visão e linguagem de alto desempenho em dispositivos com recursos limitados, superando as limitações arquiteturais inerentes aos métodos de destilação anteriores.