Apple a introduit une nouvelle architecture pour ses modèles fondamentaux de troisième génération (AFM3) qui utilise l'« Élagage de Suivi d'Instructions » pour réduire significativement le nombre de paramètres actifs. Le modèle est conçu pour activer environ 20 % de ses couches MLP en prenant des décisions de routage une fois par prompt plutôt que par token.

  • Le système conserve l'intégralité du modèle dans le stockage flash et charge uniquement un petit ensemble de paramètres « experts » (entre 1 et 4 milliards) en mémoire de travail à tout moment.
  • Un noyau d'experts partagés reste toujours actif, tandis que le reste des paramètres est chargé à la demande en fonction du prompt d'entrée.
  • Cette approche permet à un MoE actif de 30B d'atteindre une performance de bande passante de lecture comparable à celle d'un modèle actif de 14B, et transforme efficacement un modèle dense de 9B en un modèle actif de 3B.

Cette méthode vise à améliorer l'efficacité en minimisant l'utilisation de la mémoire tout en maintenant les performances grâce à des motifs d'activation clairsemés.