Des chercheurs ont développé MiLMMT-46-v1.0, un modèle de traduction automatique multilingue qui applique un post-entraînement sans référence aux grands modèles de langage ouverts. L'équipe utilise l'optimisation de politique relative par groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlée par l'identification de la langue.
- À partir des points de contrôle MiLMMT-46-v0.1 fine-tunés de manière supervisée, les auteurs appliquent l'apprentissage par renforcement et interpolent linéairement les résultats pour créer v1.0.
- Le modèle est évalué sur 46 langues et améliore constamment la qualité de la traduction par rapport à son homologue fine-tuné de manière supervisée.
- Il surpasse les bases ouvertes solides incluant Seed-X, HY-MT2 et TranslateGemma.
- Face aux systèmes propriétaires comme Google Translate, Gemini 3 Pro et GPT-5, il atteint des scores sans référence de premier plan.
- La distillation on-policy a été étudiée mais n'a pas dépassé la frontière de qualité atteinte par l'apprentissage par renforcement avec interpolation de points de contrôle.
Les auteurs publient les modèles et le code pour faciliter la recherche future dans ce domaine.