शोधकर्ताओं ने MiLMMT-46-v1.0 जारी किया है, जो एक खुला बड़ा भाषा मॉडल है जो संदर्भ-मुक्त पोस्ट-ट्रेनिंग का उपयोग करके बहुभाषी मशीन अनुवाद के लिए बनाया गया है। निगरानी-फाइन-ट्यून्ड MiLMMT-46-v0.1 से शुरू करते हुए, टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) लागू किया।

  • अंतिम मॉडल निगरानी फाइन-ट्यूनिंग और पुनर्बल सीखने के चेकपॉइंट्स को रैखिक रूप से इंटरपोलेट करके प्राप्त किया गया है।
  • 46 भाषाओं में, MiLMMT-46-v1.0 अपने SFT प्रतिद्वंद्वी की तुलना में अनुवाद गुणवत्ता में लगातार सुधार करता है।
  • यह Seed-X, HY-MT2 और TranslateGemma सहित मजबूत खुले बेलाइनों को हराता है।
  • Google Translate, Gemini 3 Pro और GPT-5 जैसे स्वामित्व वाले सिस्टम के खिलाफ अग्रणी संदर्भ-मुक्त स्कोर प्राप्त करता है।
  • ऑन-पॉलिसी डिस्टिलेशन का अध्ययन किया गया लेकिन चेकपॉइंट इंटरपोलेशन द्वारा प्राप्त गुणवत्ता सीमा को पार नहीं कर सका।

लेखकों ने इस क्षेत्र में भविष्य के शोध को सुगम बनाने के लिए मॉडल और कोड जारी किए हैं।