Para peneliti telah merilis MiLMMT-46-v1.0, sebuah model bahasa besar sumber terbuka untuk terjemahan mesin multibahasa yang memanfaatkan pasca-pelatihan tanpa referensi. Dimulai dari MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, tim menerapkan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas tanpa referensi yang dikendalikan oleh identifikasi bahasa.

  • Model akhir diperoleh melalui interpolasi linear antara titik pemeriksaan setelan halus terawasi dan pembelajaran penguatan.
  • Di 46 bahasa, MiLMMT-46-v1.0 secara konsisten meningkatkan kualitas terjemahan dibandingkan dengan rekan SFT-nya.
  • Model ini mengungguli baseline sumber terbuka yang kuat termasuk Seed-X, HY-MT2, dan TranslateGemma.
  • Model ini mencapai skor tanpa referensi terdepan melawan sistem tertutup seperti Google Translate, Gemini 3 Pro, dan GPT-5.
  • Distilasi on-policy diselidiki tetapi tidak melampaui batas kualitas yang dicapai oleh RL dengan interpolasi titik pemeriksaan.

Para penulis merilis model dan kode untuk memfasilitasi penelitian di masa depan di bidang ini.