Upstage ha lanzado Solar Open 2, un modelo de lenguaje grande de pesos abiertos con 250 mil millones de parámetros diseñado para flujos de trabajo agénticos como productividad de oficina y programación. El modelo utiliza una arquitectura Híbrida de Atención Mezcla de Expertos que activa solo 15 mil millones de parámetros por token para ofrecer inferencia eficiente.

  • Cuenta con una ventana de contexto de 1M tokens lograda eliminando la codificación posicional en favor de la codificación de orden intrínseco dentro de las capas de atención lineal.
  • La eficiencia del entrenamiento se mejora inicializando el modelo con transferencia selectiva de pesos desde Solar Open 1, transfiriendo solo el 2.3% de los pesos.
  • La arquitectura intercala tres capas de atención lineal con una capa de atención softmax, reduciendo el uso de memoria de la caché KV a aproximadamente una cuarta parte de un modelo todo-softmax.
  • El modelo soporta inglés, coreano y japonés y es competitivo con otros modelos de pesos abiertos en benchmarks de agentes.

El lanzamiento proporciona un modelo de alta capacidad optimizado para tareas de contexto largo y capacidades de llamada de herramientas mientras mantiene bajos los costos de inferencia.