A Upstage lançou o Solar Open 2, um modelo de linguagem grande de pesos abertos com 250 bilhões de parâmetros, projetado para fluxos de trabalho agênticos como produtividade de escritório e programação. O modelo utiliza uma arquitetura de Mixture-of-Experts com Hybrid-Attention que ativa apenas 15 bilhões de parâmetros por token para oferecer inferência eficiente.
- Apresenta uma janela de contexto de 1M tokens, alcançada ao remover a codificação posicional em favor da codificação de ordem intrínseca nas camadas de linear-attention.
- A eficiência do treinamento é aprimorada ao inicializar o modelo com transferência seletiva de pesos do Solar Open 1, transferindo apenas 2,3% dos pesos.
- A arquitetura intercala três camadas de linear-attention com uma camada de softmax-attention, reduzindo o uso de memória do KV cache para cerca de um quarto de um modelo totalmente softmax.
- O modelo suporta inglês, coreano e japonês e é competitivo em relação a outros modelos de pesos abertos em benchmarks agênticos.
O lançamento fornece um modelo de alta capacidade otimizado para tarefas de contexto longo e capacidades de chamada de ferramentas, mantendo baixos custos de inferência.