Pesquisadores lançaram o MiLMMT-46-v1.0, um modelo de linguagem grande de código aberto para tradução automática multilíngue que utiliza pós-treinamento sem referência. Partindo do MiLMMT-46-v0.1 ajustado por supervisão, a equipe aplicou Group Relative Policy Optimization (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlados por identificação de idioma.

  • O modelo final é obtido por interpolação linear dos checkpoints de ajuste fino supervisionado e aprendizado por reforço.
  • Em 46 idiomas, o MiLMMT-46-v1.0 melhora consistentemente a qualidade da tradução em relação à sua contraparte SFT.
  • Ele supera fortes linhas de base abertas, incluindo Seed-X, HY-MT2 e TranslateGemma.
  • O modelo alcança as melhores pontuações sem referência contra sistemas proprietários como Google Translate, Gemini 3 Pro e GPT-5.
  • A destilação on-policy foi investigada, mas não superou a fronteira de qualidade alcançada pelo RL com interpolação de checkpoints.

Os autores lançam os modelos e o código para facilitar pesquisas futuras nesta área.