연구진은 오픈 대규모 언어 모델에 레퍼런스 없는 사후 학습을 적용하는 다국어 기계 번역 모델인 MiLMMT-46-v1.0을 개발했습니다. 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 사용합니다.

  • 감독 학습 파인튜닝된 MiLMMT-46-v0.1 체크포인트에서 시작하여 저자들은 강화 학습을 적용하고 결과를 선형 보간하여 v1.0을 생성합니다.
  • 이 모델은 46개 언어에 걸쳐 평가되었으며, 감독 학습 파인튜닝 버전보다 번역 품질을 일관되게 향상시킵니다.
  • Seed-X, HY-MT2, TranslateGemma를 포함한 강력한 오픈 베이스라인을 능가합니다.
  • Google Translate, Gemini 3 Pro, GPT-5와 같은 독점 시스템에 비해 선도적인 레퍼런스 없는 점수를 달성했습니다.
  • 온-폴리시 디스틸레이션이 조사되었으나 체크포인트 보간과 함께 강화 학습이 달성한 품질 한계를 넘지 못했습니다.

저자들은 이 분야의 향후 연구를 촉진하기 위해 모델과 코드를 공개합니다.