Uma proposta no Hugging Face discute dois problemas interligados na IA: a dependência do treinamento de grandes modelos separados e a dependência do ecossistema em GPUs de propósito geral.
- O autor sugere o "crescimento progressivo de modelos", onde um modelo se expande estruturalmente (por exemplo, de 4B para 8B) preservando as representações aprendidas, em vez de começar do zero para cada tamanho.
- Essa abordagem complementa a transferência de conhecimento de tamanho fixo, permitindo que os modelos absorvam mais capacidade antes que a expansão estrutural seja necessária.
- Para abordar as limitações de hardware, o autor propõe um "Perfil de Hardware de IA" para Transformers, definindo um conjunto estável de operações comuns (como GEMM e atenção) para fabricantes especializados de ASIC.
- A proposta argumenta que os lançamentos de modelos devem avaliar métricas de eficiência como tokens por joule e requisitos de memória junto com a contagem de parâmetros.
O autor acredita que essas mudanças podem ajudar usuários locais de IA a superar os limites de VRAM e fornecer aos fabricantes de hardware um alvo claro de otimização.