Una propuesta en Hugging Face discute dos problemas interconectados en la IA: la dependencia del entrenamiento de modelos grandes separados y la dependencia del ecosistema de GPUs de propósito general.
- El autor sugiere el "crecimiento progresivo de modelos", donde un modelo se expande estructuralmente (por ejemplo, de 4B a 8B) preservando las representaciones aprendidas, en lugar de empezar desde cero para cada tamaño.
- Este enfoque complementa la transferencia de conocimiento de tamaño fijo, permitiendo que los modelos absorban más capacidad antes de que sea necesaria una expansión estructural.
- Para abordar las limitaciones de hardware, el autor propone un "Perfil de Hardware de IA" para Transformers, definiendo un conjunto estable de operaciones comunes (como GEMM y atención) para fabricantes especializados de ASIC.
- La propuesta argumenta que los lanzamientos de modelos deben evaluar métricas de eficiencia como tokens por julio y requisitos de memoria junto con el recuento de parámetros.
El autor cree que estos cambios podrían ayudar a los usuarios locales de IA a superar los límites de VRAM y proporcionar a los fabricantes de hardware un objetivo claro de optimización.