Los investigadores presentan GenRecal, un marco de destilación de propósito general que transfiere conocimiento de grandes modelos de visión y lenguaje (VLM) a contrapartes más pequeñas y eficientes. El método aborda el desafío de las arquitecturas VLM heterogéneas mediante un Recalibrador para alinear y adaptar las representaciones de características entre diferentes tipos de modelos.

  • GenRecal permite una transferencia de conocimiento efectiva entre VLM construidos sobre diferentes LLM con tipos de token, tamaños de vocabulario y ordenamientos de índice variables.
  • Experimentos exhaustivos en múltiples benchmarks desafiantes muestran que GenRecal mejora significativamente los rendimientos base.
  • Los modelos pequeños destilados eventualmente superan a los VLM grandes de código abierto y cerrado.

Este marco permite el despliegue de capacidades de visión y lenguaje de alto rendimiento en dispositivos con recursos limitados, superando las limitaciones arquitectónicas inherentes a los métodos de destilación anteriores.