أطلق الباحثون نموذج MiLMMT-46-v1.0، وهو نموذج لغوي كبير مفتوح المصدر للترجمة الآلية متعددة اللغات، يعتمد على ما بعد التدريب بدون مرجع. بدءاً من النسخة المدققة بالإشراف MiLMMT-46-v0.1، طبق الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تستند إلى نموذجين لتقدير الجودة بدون مرجع، يتم تفعيلهما عبر تحديد اللغة.

  • تم الحصول على النموذج النهائي عن طريق الاستيفاء الخطي بين نقاط التفتيش الخاصة بالدقة المدققة بالإشراف والتعلم المعزز.
  • عبر 46 لغة، يحسّن MiLMMT-46-v1.0 باستمرار جودة الترجمة مقارنة بنظيره المدقق بالإشراف (SFT).
  • يتفوق على الأساسيات المفتوحة القوية بما في ذلك Seed-X وHY-MT2 وTranslateGemma.
  • يحقق النموذج أعلى النتائج بدون مرجع مقارنة بالأنظمة المملوكة مثل Google Translate وGemini 3 Pro وGPT-5.
  • تم استكشاف التقطير القائم على السياسة (on-policy distillation) لكنه لم يتجاوز حدود الجودة التي حققها التعلم المعزز مع الاستيفاء بين نقاط التفتيش.

أطلق المؤلفون النماذج والكود لتسهيل البحث المستقبلي في هذا المجال.