研究人员开发了 MiLMMT-46-v1.0,这是一种多语言机器翻译模型,将无参考后训练应用于开源大语言模型。该团队使用基于两种无参考质量评估模型的奖励(由语言识别门控)的组相对策略优化 (GRPO)。

  • 从监督微调的 MiLMMT-46-v0.1 检查点开始,作者应用强化学习并线性插值结果以创建 v1.0。
  • 该模型在 46 种语言上进行评估,其翻译质量始终优于其监督微调对应模型。
  • 它优于包括 Seed-X、HY-MT2 和 TranslateGemma 在内的强大开源基线。
  • 与 Google Translate、Gemini 3 Pro 和 GPT-5 等专有系统相比,它取得了领先的无参考分数。
  • 研究了在线策略蒸馏,但未能超越通过检查点插值实现的强化学习所达到的质量前沿。

作者发布了模型和代码,以促进该领域的未来研究。