Upstage a publié Solar Open 2, un grand modèle de langage à poids ouverts avec 250 milliards de paramètres conçu pour les flux de travail agents tels que la productivité bureautique et la programmation. Le modèle utilise une architecture Mixture-of-Experts à Hybrid-Attention qui n'active que 15 milliards de paramètres par token pour offrir une inférence efficace.
- Il dispose d'une fenêtre de contexte de 1M de tokens obtenue en supprimant le codage positionnel au profit d'un encodage d'ordre intrinsèque dans les couches à attention linéaire.
- L'efficacité de l'entraînement est améliorée par l'initialisation du modèle avec un transfert sélectif des poids depuis Solar Open 1, ne conservant que 2,3 % des poids.
- L'architecture alterne trois couches d'attention linéaire avec une couche d'attention softmax, réduisant l'utilisation de la mémoire KV cache à environ un quart d'un modèle entièrement softmax.
- Le modèle prend en charge l'anglais, le coréen et le japonais et est compétitif par rapport aux autres modèles à poids ouverts sur les benchmarks agents.
La publication fournit un modèle à haute capacité optimisé pour les tâches de contexte long et les capacités d'appel d'outils tout en maintenant des coûts d'inférence faibles.