طوّر الباحثون نموذج MiLMMT-46-v1.0 للترجمة الآلية متعددة اللغات، الذي يطبّق ما بعد التدريب بدون مرجع على نماذج لغوية كبيرة مفتوحة المصدر. يستخدم الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تعتمد على نموذجين لتقدير الجودة بدون مرجع، يتم التحكم فيهما عبر تحديد اللغة.
- بدءاً من نقاط التفتيش MiLMMT-46-v0.1 المُدقَّقة بالإشراف، يطبّق المؤلفون التعلم المعزز ويقومون باستيفاء خطي للنتائج لإنشاء الإصدار v1.0.
- يُقيَّم النموذج عبر 46 لغة ويحسّن باستمرار جودة الترجمة مقارنة بنظيره المدقق بالإشراف.
- يتفوق على الأساسيات المفتوحة القوية بما في ذلك Seed-X وHY-MT2 وTranslateGemma.
- أمام الأنظمة المملوكة مثل Google Translate وGemini 3 Pro وGPT-5، يحقق أعلى النتائج بدون مرجع.
- تم استكشاف الاستدلال المباشر (on-policy distillation) لكنه لم يتجاوز حدود الجودة التي حققها التعلم المعزز مع استيفاء نقاط التفتيش.
يُصدر المؤلفون النماذج والكود لتسهيل الأبحاث المستقبلية في هذا المجال.