Para peneliti telah merilis MiLMMT-46-v1.0, sebuah model bahasa besar sumber terbuka untuk terjemahan mesin multibahasa yang memanfaatkan pasca-pelatihan tanpa referensi. Dimulai dari MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, tim menerapkan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas tanpa referensi yang dikendalikan oleh identifikasi bahasa.
- Model akhir diperoleh melalui interpolasi linear antara titik pemeriksaan setelan halus terawasi dan pembelajaran penguatan.
- Di 46 bahasa, MiLMMT-46-v1.0 secara konsisten meningkatkan kualitas terjemahan dibandingkan dengan rekan SFT-nya.
- Model ini mengungguli baseline sumber terbuka yang kuat termasuk Seed-X, HY-MT2, dan TranslateGemma.
- Model ini mencapai skor tanpa referensi terdepan melawan sistem tertutup seperti Google Translate, Gemini 3 Pro, dan GPT-5.
- Distilasi on-policy diselidiki tetapi tidak melampaui batas kualitas yang dicapai oleh RL dengan interpolasi titik pemeriksaan.
Para penulis merilis model dan kode untuk memfasilitasi penelitian di masa depan di bidang ini.