Uma proposta no Hugging Face discute dois problemas interligados na IA: a dependência do treinamento de grandes modelos separados e a dependência do ecossistema em GPUs de propósito geral.

  • O autor sugere o "crescimento progressivo de modelos", onde um modelo se expande estruturalmente (por exemplo, de 4B para 8B) preservando as representações aprendidas, em vez de começar do zero para cada tamanho.
  • Essa abordagem complementa a transferência de conhecimento de tamanho fixo, permitindo que os modelos absorvam mais capacidade antes que a expansão estrutural seja necessária.
  • Para abordar as limitações de hardware, o autor propõe um "Perfil de Hardware de IA" para Transformers, definindo um conjunto estável de operações comuns (como GEMM e atenção) para fabricantes especializados de ASIC.
  • A proposta argumenta que os lançamentos de modelos devem avaliar métricas de eficiência como tokens por joule e requisitos de memória junto com a contagem de parâmetros.

O autor acredita que essas mudanças podem ajudar usuários locais de IA a superar os limites de VRAM e fornecer aos fabricantes de hardware um alvo claro de otimização.