Исследователи разработали MiLMMT-46-v1.0, модель многоязычного машинного перевода, которая применяет постобучение без эталона к открытым большим языковым моделям. Команда использует Group Relative Policy Optimization (GRPO) с наградой, основанной на двух моделях оценки качества без эталона, управляемых идентификацией языка.
- Начиная с контрольных точек MiLMMT-46-v0.1, дообученных с учителем, авторы применяют обучение с подкреплением и линейно интерполируют результаты для создания v1.0.
- Модель оценивается на 46 языках и последовательно улучшает качество перевода по сравнению с её аналогом, дообученным с учителем.
- Она превосходит сильные открытые базовые модели, включая Seed-X, HY-MT2 и TranslateGemma.
- По сравнению с проприетарными системами, такими как Google Translate, Gemini 3 Pro и GPT-5, она достигает ведущих показателей без эталона.
- Дистилляция on-policy исследовалась, но не превзошла качество, достигнутое RL с интерполяцией контрольных точек.
Авторы публикуют модели и код, чтобы способствовать будущим исследованиям в этой области.