研究人员发布了 MiLMMT-46-v1.0,这是一个用于多语言机器翻译的开源大型语言模型,采用了无参考后训练技术。该团队从监督微调的 MiLMMT-46-v0.1 出发,应用了基于两种由语言识别门控的无参考质量评估模型的奖励的组相对策略优化(GRPO)。
- 最终模型是通过线性插值监督微调和强化学习检查点获得的。
- 在 46 种语言上,MiLMMT-46-v1.0 的翻译质量持续优于其 SFT 对应版本。
- 它超越了包括 Seed-X、HY-MT2 和 TranslateGemma 在内的强大开源基线。
- 与 Google Translate、Gemini 3 Pro 和 GPT-5 等专有系统相比,该模型在参考-free 评分中处于领先地位。
- 虽然研究了策略内蒸馏,但其质量未能超越通过检查点插值实现的 RL 所达到的质量前沿。
作者发布了模型和代码,以促进该领域的未来研究。