Pesquisadores desenvolveram o MiLMMT-46-v1.0, um modelo de tradução automática multilíngue que aplica pós-treinamento sem referência em grandes modelos de linguagem de código aberto. A equipe utiliza Otimização de Política Relativa de Grupo (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlada por identificação de idioma.

  • Partindo dos checkpoints MiLMMT-46-v0.1 ajustados supervisionadamente, os autores aplicam aprendizado por reforço e interpolam linearmente os resultados para criar o v1.0.
  • O modelo é avaliado em 46 idiomas e melhora consistentemente a qualidade da tradução em relação à sua contraparte de ajuste fino supervisionado.
  • Ele supera fortes linhas de base de código aberto, incluindo Seed-X, HY-MT2 e TranslateGemma.
  • Em comparação com sistemas proprietários como Google Translate, Gemini 3 Pro e GPT-5, ele alcança as melhores pontuações sem referência.
  • A destilação on-policy foi investigada, mas não superou a fronteira de qualidade alcançada pelo RL com interpolação de checkpoints.

Os autores lançam os modelos e o código para facilitar pesquisas futuras nesta área.