AntLing a publié six checkpoints de modèles de base pour ses architectures Ling-3.0-tiny et Ling-3.0-flash, couvrant les étapes de pré-entraînement, mi-entraînement et fusionnées WSM. Ces modèles n'ont pas subi d'entraînement postérieur, offrant aux chercheurs des points de départ flexibles pour un pré-entraînement continu, un affinage et d'autres recherches.

  • La publication utilise la Fusion de Checkpoints Pondérés (WSM) pour remplacer la décroissance du taux d'apprentissage, facilitant l'exploration hors ligne de différentes stratégies et une meilleure adéquation avec le pré-entraînement continu.
  • Ling-3.0-tiny-base comporte 7,9 milliards de paramètres au total avec 1,3 milliard actifs, offrant des performances comparables ou supérieures sur la plupart des benchmarks par rapport à Ling-2.5-mini-base, en particulier en codage.
  • Ling-3.0-flash-base contient 124 milliards de paramètres au total avec 5,1 milliards actifs, atteignant de solides résultats en codage, raisonnement et tâches à long contexte malgré sa taille inférieure à celle des concurrents.
  • Une recette d'entraînement partagée permet à la communauté de valider des stratégies sur le modèle tiny-base avant de les mettre à l'échelle vers l'architecture flash-base.

La publication permet une adaptation au domaine dans des applications spécialisées telles que la finance et la santé, tout en soutenant les études sur le comportement des modèles et la recherche MoE grâce à sa structure d'activation sparse.