Apple представила новую архитектуру для своих фундаментальных моделей третьего поколения (AFM3), которая использует «Pruning следования инструкциям» для значительного снижения количества активных параметров. Модель спроектирована так, чтобы активировать примерно 20% своих MLP слоёв, принимая решения маршрутизации один раз на промпт, а не на токен.
- Система хранит всю модель во flash-памяти и загружает только небольшой набор «экспертных» параметров (от 1 до 4 миллиардов) в оперативную память одновременно.
- Ядро из общих экспертов остаётся всегда активным, тогда как остальные параметры загружаются по требованию на основе входного промпта.
- Этот подход позволяет 30B активному MoE достичь производительности пропускной способности чтения, сопоставимой с 14B активной моделью, и эффективно превращает 9B плотную модель в 3B активную.
Этот метод направлен на повышение эффективности за счёт минимизации использования памяти при сохранении производительности через разреженные паттерны активации.