연구자들이 레퍼런스 없는 사후 학습을 활용하는 다국어 기계 번역용 오픈 대규모 언어 모델인 MiLMMT-46-v1.0을 공개했습니다. 감독 학습 파인튜닝된 MiLMMT-46-v0.1을 기반으로, 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 적용했습니다.
- 최종 모델은 감독 학습 파인튜닝 체크포인트와 강화학습 체크포인트를 선형 보간하여 얻습니다.
- 46개 언어 전반에 걸쳐 MiLMMT-46-v1.0은 기존 SFT 모델 대비 번역 품질을 일관되게 향상시킵니다.
- Seed-X, HY-MT2, TranslateGemma를 포함한 강력한 오픈 베라인을 능가합니다.
- Google Translate, Gemini 3 Pro, GPT-5와 같은 독점 시스템에 대해 레퍼런스 없는 점수에서 최상위 성능을 달성합니다.
- 온-policy 증류는 조사되었으나, 체크포인트 보간과 함께 강화학습이 달성한 품질 한계를 넘지 못했습니다.
저자들은 이 분야의 향후 연구를 촉진하기 위해 모델과 코드를 공개했습니다.