Apple ha presentado una nueva arquitectura para sus modelos base de tercera generación (AFM3) que utiliza "Poda de Seguimiento de Instrucciones" para reducir significativamente el conteo de parámetros activos. El modelo está diseñado para activar aproximadamente el 20% de sus capas MLP tomando decisiones de enrutamiento una vez por prompt en lugar de por token.
- El sistema mantiene todo el modelo en almacenamiento flash y carga solo un pequeño conjunto de parámetros "expertos" (entre 1 y 4 mil millones) en la memoria de trabajo en cualquier momento.
- Un núcleo de expertos compartidos permanece siempre activo, mientras que el resto de los parámetros se cargan bajo demanda según el prompt de entrada.
- Este enfoque permite que un MoE activo de 30B logre un rendimiento de ancho de banda de lectura comparable a un modelo activo de 14B, y convierte efectivamente un modelo denso de 9B en uno activo de 3B.
Este método tiene como objetivo mejorar la eficiencia minimizando el uso de memoria mientras mantiene el rendimiento a través de patrones de activación dispersos.