AntLing ha publicado seis puntos de control del modelo base para sus arquitecturas Ling-3.0-tiny y Ling-3.0-flash, que cubren las etapas de preentrenado, entrenamiento intermedio y fusión WSM. Estos modelos no han pasado por postentrenamiento, proporcionando a los investigadores puntos de partida flexibles para el preentrenamiento continuo, ajuste fino y más investigación.

  • El lanzamiento utiliza la Fusión de Puntos de Control Ponderados (WSM) para reemplazar la disminución de la tasa de aprendizaje, facilitando la exploración fuera de línea de diferentes estrategias y una mayor adecuación al preentrenamiento continuo.
  • Ling-3.0-tiny-base cuenta con 7.9B parámetros totales y 1.3B activos, ofreciendo un rendimiento comparable o superior en la mayoría de las pruebas en comparación con Ling-2.5-mini-base, especialmente en codificación.
  • Ling-3.0-flash-base contiene 124B parámetros totales y 5.1B activos, logrando resultados sólidos en tareas de codificación, razonamiento y contexto largo a pesar de ser más pequeño que los competidores.
  • Una receta de entrenamiento compartida permite a la comunidad validar estrategias en el modelo tiny-base antes de escalarlas a la arquitectura flash-base.

El lanzamiento permite la adaptación de dominio en aplicaciones especializadas como finanzas y atención médica, mientras apoya estudios del comportamiento del modelo e investigación MoE a través de su estructura de activación dispersa.