A Apple introduziu uma nova arquitetura para seus modelos fundamentais de terceira geração (AFM3) que utiliza "Poda de Seguimento de Instruções" para reduzir significativamente a contagem de parâmetros ativos. O modelo é projetado para ativar aproximadamente 20% de suas camadas MLP tomando decisões de roteamento uma vez por prompt, em vez de por token.

  • O sistema mantém o modelo inteiro no armazenamento flash e carrega apenas um pequeno conjunto de parâmetros "especialistas" (entre 1 e 4 bilhões) na memória de trabalho a qualquer momento.
  • Um núcleo de especialistas compartilhados permanece sempre ativo, enquanto o restante dos parâmetros é carregado sob demanda com base no prompt de entrada.
  • Essa abordagem permite que um MoE ativo de 30B alcance desempenho de largura de banda de leitura comparável a um modelo ativo de 14B, e efetivamente transforma um modelo denso de 9B em um ativo de 3B.

Este método visa melhorar a eficiência minimizando o uso de memória enquanto mantém o desempenho por meio de padrões de ativação esparsos.