A AntLing lançou seis checkpoints de modelos base para suas arquiteturas Ling-3.0-tiny e Ling-3.0-flash, abrangendo estágios de pré-treinado, intermediário e mesclados com WSM. Esses modelos não passaram por pós-treinamento, fornecendo aos pesquisadores pontos de partida flexíveis para pré-treinamento contínuo, ajuste fino e pesquisas adicionais.
- O lançamento utiliza a Mesclagem Ponderada de Checkpoints (WSM) para substituir o decaimento da taxa de aprendizado, facilitando a exploração offline de diferentes estratégias e melhor adequação ao pré-treinamento contínuo.
- O Ling-3.0-tiny-base possui 7,9B de parâmetros totais com 1,3B ativos, entregando desempenho comparável ou superior na maioria dos benchmarks em comparação ao Ling-2.5-mini-base, particularmente em codificação.
- O Ling-3.0-flash-base contém 124B de parâmetros totais com 5,1B ativos, alcançando resultados sólidos em tarefas de codificação, raciocínio e contexto longo, apesar de ser menor que os concorrentes.
- Uma receita de treinamento compartilhada permite que a comunidade valide estratégias no modelo tiny-base antes de escalá-las para a arquitetura flash-base.
O lançamento permite adaptação de domínio em aplicações especializadas como finanças e saúde, enquanto apoia estudos de comportamento do modelo e pesquisas sobre MoE por meio de sua estrutura de ativação esparsa.