أطلق الباحثون نموذج MiLMMT-46-v1.0، وهو نموذج لغوي كبير مفتوح المصدر للترجمة الآلية متعددة اللغات، يعتمد على ما بعد التدريب بدون مرجع. بدءاً من النسخة المدققة بالإشراف MiLMMT-46-v0.1، طبق الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تستند إلى نموذجين لتقدير الجودة بدون مرجع، يتم تفعيلهما عبر تحديد اللغة.
- تم الحصول على النموذج النهائي عن طريق الاستيفاء الخطي بين نقاط التفتيش الخاصة بالدقة المدققة بالإشراف والتعلم المعزز.
- عبر 46 لغة، يحسّن MiLMMT-46-v1.0 باستمرار جودة الترجمة مقارنة بنظيره المدقق بالإشراف (SFT).
- يتفوق على الأساسيات المفتوحة القوية بما في ذلك Seed-X وHY-MT2 وTranslateGemma.
- يحقق النموذج أعلى النتائج بدون مرجع مقارنة بالأنظمة المملوكة مثل Google Translate وGemini 3 Pro وGPT-5.
- تم استكشاف التقطير القائم على السياسة (on-policy distillation) لكنه لم يتجاوز حدود الجودة التي حققها التعلم المعزز مع الاستيفاء بين نقاط التفتيش.
أطلق المؤلفون النماذج والكود لتسهيل البحث المستقبلي في هذا المجال.