शोधकर्ताओं ने MiLMMT-46-v1.0 विकसित किया है, जो एक बहुभाषी मशीन अनुवाद मॉडल है जो खुले बड़े भाषा मॉडलों पर संदर्भ-मुक्त पोस्ट-ट्रेनिंग लागू करता है। टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग किया है।

  • निगरानी-फाइन-ट्यून्ड MiLMMT-46-v0.1 चेकप्वाइंट्स से शुरू करते हुए, लेखकों ने रीइंफोर्समेंट लर्निंग लागू की और परिणामों को रैखिक रूप में इंटरपोलेट कर v1.0 बनाया।
  • मॉडल का 46 भाषाओं पर मूल्यांकन किया गया और यह निरंतर अपने निगरानी फाइन-ट्यूनिंग समकक्ष की तुलना में अनुवाद गुणवत्ता में सुधार करता है।

यह Seed-X, HY-MT2, और TranslateGemma सहित मजबूत खुले बेलाइनों को पछाड़ता है।

  • Google Translate, Gemini 3 Pro, और GPT-5 जैसे प्रोप्राइटरी सिस्टम के खिलाफ, यह अग्रणी संदर्भ-मुक्त स्कोर प्राप्त करता है।
  • ऑन-पॉलिसी डिस्टिलेशन की जांच की गई लेकिन चेकप्वाइंट इंटरपोलेशन के साथ RL द्वारा प्राप्त गुणवत्ता सीमा को पार नहीं किया गया।

लेखकों ने इस क्षेत्र में भविष्य के शोध को सुगम बनाने के लिए मॉडल और कोड जारी किए हैं।