Una propuesta en Hugging Face discute dos problemas interconectados en la IA: la dependencia del entrenamiento de modelos grandes separados y la dependencia del ecosistema de GPUs de propósito general.

  • El autor sugiere el "crecimiento progresivo de modelos", donde un modelo se expande estructuralmente (por ejemplo, de 4B a 8B) preservando las representaciones aprendidas, en lugar de empezar desde cero para cada tamaño.
  • Este enfoque complementa la transferencia de conocimiento de tamaño fijo, permitiendo que los modelos absorban más capacidad antes de que sea necesaria una expansión estructural.
  • Para abordar las limitaciones de hardware, el autor propone un "Perfil de Hardware de IA" para Transformers, definiendo un conjunto estable de operaciones comunes (como GEMM y atención) para fabricantes especializados de ASIC.
  • La propuesta argumenta que los lanzamientos de modelos deben evaluar métricas de eficiencia como tokens por julio y requisitos de memoria junto con el recuento de parámetros.

El autor cree que estos cambios podrían ayudar a los usuarios locales de IA a superar los límites de VRAM y proporcionar a los fabricantes de hardware un objetivo claro de optimización.