Исследователи выпустили MiLMMT-46-v1.0, открытую большую языковую модель для многоязычного машинного перевода, использующую обучение после тренировки без эталонов. Начиная с дообученной в режиме обучения с учителем версии MiLMMT-46-v0.1, команда применила групповую относительную оптимизацию политики (GRPO) с наградой, основанной на двух моделях оценки качества без эталонов, управляемых идентификацией языка.
- Итоговая модель получается путём линейной интерполяции контрольных точек дообучения в режиме обучения с учителем и обучения с подкреплением.
- Для 46 языков MiLMMT-46-v1.0 последовательно улучшает качество перевода по сравнению с её версией, обученной с учителем (SFT).
- Она превосходит сильные открытые базовые модели, включая Seed-X, HY-MT2 и TranslateGemma.
- Модель достигает ведущих показателей без эталонов по сравнению с проприетарными системами, такими как Google Translate, Gemini 3 Pro и GPT-5.
- Исследовалась дистилляция на основе он-полосного (on-policy) подхода, но она не превзошла качество, достигнутое методом обучения с подкреплением с интерполяцией контрольных точек.
Авторы публикуют модели и код, чтобы облегчить будущие исследования в этой области.