Para peneliti telah mengembangkan MiLMMT-46-v1.0, sebuah model terjemahan mesin multibahasa yang menerapkan pasca-pelatihan bebas referensi pada model bahasa besar sumber terbuka. Tim menggunakan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas bebas referensi, yang dikendalikan oleh identifikasi bahasa.

  • Dimulai dari checkpoint MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, para penulis menerapkan pembelajaran penguatan dan melakukan interpolasi linear terhadap hasilnya untuk membuat v1.0.
  • Model dievaluasi di 46 bahasa dan secara konsisten meningkatkan kualitas terjemahan dibandingkan dengan rekan setel halusnya yang terawasi.
  • Model ini mengungguli baseline sumber terbuka yang kuat termasuk Seed-X, HY-MT2, dan TranslateGemma.
  • Terhadap sistem tertutup seperti Google Translate, Gemini 3 Pro, dan GPT-5, model ini mencapai skor bebas referensi terdepan.
  • Distilasi on-policy diselidiki tetapi tidak melampaui batas kualitas yang dicapai oleh RL dengan interpolasi checkpoint.

Para penulis merilis model dan kode untuk memfasilitasi penelitian masa depan di bidang ini.