Upstage发布了Solar Open 2,这是一款拥有2500亿参数的开源大语言模型,专为办公生产力和编码等智能体工作流设计。该模型采用混合注意力专家混合(Hybrid-Attention Mixture-of-Experts)架构,每个token仅激活150亿参数,以实现高效的推理。
- 通过移除位置编码并在线性注意力层中采用内在顺序编码,实现了1M token的上下文窗口。
- 通过将Solar Open 1中的选择性权重转移至模型初始化,仅继承2.3%的权重,从而提升了训练效率。
- 架构将三个线性注意力层与一个softmax注意力层交错排列,将KV缓存内存使用量降低至全softmax模型的约四分之一。
- 该模型支持英语、韩语和日语,在智能体基准测试中与其他开源权重模型具有竞争力。
此次发布提供了一个针对长上下文任务和工具调用能力优化的高容量模型,同时保持了较低的推理成本。