В техническом отчете Solar Open 2 представлена модель Solar Open 2, языковая модель Mixture-of-Experts с архитектурой 250B-A15B, предназначенная для долгосрочных агентских задач. Она обеспечивает контекстное окно на 1M токенов благодаря гибридной стековой архитектуре внимания и обучается с использованием эффективной инициализации на основе Solar Open 1 и тщательно отобранных высокоценных данных.
- Модель использует механизм гибридного внимания, включающий один слой softmax среди каждых трех слоев линейного внимания, без позиционного кодирования и с пороговым правилом дельты, расширенным на отрицательные собственные значения.
- Эффективность обучения достигается за счет инициализации от общей структуры Solar Open 1 и уточнения пула данных объемом 20T до смеси объемом 10T посредством курирования с учетом качества и редкости.
- Навыки агентов консолидируются из двенадцати специалистов по различным областям с помощью многоучительского дистилляции на основе текущей политики (MOPD).
- Solar Open 2 лидирует среди открытых моделей сопоставимого размера на MMLU-Pro, LiveCodeBench и наборе APEX-Agents, оставаясь конкурентоспособной по сравнению с DeepSeek-V4-Flash и MiMo-V2.5.
- На корейских бенчмарках она демонстрирует самый высокий средний результат среди сравненных моделей и является конкурентоспособной по сравнению с DeepSeek-V4-Pro при размере менее чем в шестую часть от его размера.
В отчете подчеркивается способность Solar Open 2 удерживать всю траекторию агента в одном контексте, сохраняя высокую производительность на бенчмарках для английского и корейского языков.