Para peneliti telah mengembangkan MiLMMT-46-v1.0, sebuah model terjemahan mesin multibahasa yang menerapkan pasca-pelatihan bebas referensi pada model bahasa besar sumber terbuka. Tim menggunakan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas bebas referensi, yang dikendalikan oleh identifikasi bahasa.
- Dimulai dari checkpoint MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, para penulis menerapkan pembelajaran penguatan dan melakukan interpolasi linear terhadap hasilnya untuk membuat v1.0.
- Model dievaluasi di 46 bahasa dan secara konsisten meningkatkan kualitas terjemahan dibandingkan dengan rekan setel halusnya yang terawasi.
- Model ini mengungguli baseline sumber terbuka yang kuat termasuk Seed-X, HY-MT2, dan TranslateGemma.
- Terhadap sistem tertutup seperti Google Translate, Gemini 3 Pro, dan GPT-5, model ini mencapai skor bebas referensi terdepan.
- Distilasi on-policy diselidiki tetapi tidak melampaui batas kualitas yang dicapai oleh RL dengan interpolasi checkpoint.
Para penulis merilis model dan kode untuk memfasilitasi penelitian masa depan di bidang ini.