Исследователи разработали MiLMMT-46-v1.0, модель многоязычного машинного перевода, которая применяет постобучение без эталона к открытым большим языковым моделям. Команда использует Group Relative Policy Optimization (GRPO) с наградой, основанной на двух моделях оценки качества без эталона, управляемых идентификацией языка.

  • Начиная с контрольных точек MiLMMT-46-v0.1, дообученных с учителем, авторы применяют обучение с подкреплением и линейно интерполируют результаты для создания v1.0.
  • Модель оценивается на 46 языках и последовательно улучшает качество перевода по сравнению с её аналогом, дообученным с учителем.
  • Она превосходит сильные открытые базовые модели, включая Seed-X, HY-MT2 и TranslateGemma.
  • По сравнению с проприетарными системами, такими как Google Translate, Gemini 3 Pro и GPT-5, она достигает ведущих показателей без эталона.
  • Дистилляция on-policy исследовалась, но не превзошла качество, достигнутое RL с интерполяцией контрольных точек.

Авторы публикуют модели и код, чтобы способствовать будущим исследованиям в этой области.