Les chercheurs ont publié MiLMMT-46-v1.0, un grand modèle de langage ouvert pour la traduction automatique multilingue qui utilise un post-apprentissage sans référence. À partir du MiLMMT-46-v0.1 finement ajusté par apprentissage supervisé, l'équipe a appliqué l'optimisation relative de politique de groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlés par identification de la langue.
- Le modèle final est obtenu par interpolation linéaire des points de contrôle du finissage supervisé et de l'apprentissage par renforcement.
- Sur 46 langues, MiLMMT-46-v1.0 améliore constamment la qualité de la traduction par rapport à son homologue SFT.
- Il surpasse les bases ouvertes solides incluant Seed-X, HY-MT2 et TranslateGemma.
- Le modèle atteint des scores sans référence de premier plan face aux systèmes propriétaires tels que Google Translate, Gemini 3 Pro et GPT-5.
- La distillation on-policy a été étudiée mais n'a pas dépassé la frontière de qualité atteinte par l'apprentissage par renforcement avec interpolation des points de contrôle.
Les auteurs publient les modèles et le code pour faciliter la recherche future dans ce domaine.