Los investigadores han lanzado MiLMMT-46-v1.0, un modelo de lenguaje grande de código abierto para traducción automática multilingüe que utiliza postentrenamiento sin referencia. Partiendo del MiLMMT-46-v0.1 ajustado por supervisión, el equipo aplicó la Optimización de Política Relativa por Grupos (GRPO) con una recompensa basada en dos modelos de estimación de calidad sin referencia controlados por identificación de idioma.
- El modelo final se obtiene interpolando linealmente los puntos de control del ajuste fino supervisado y del aprendizaje por refuerzo.
- En 46 idiomas, MiLMMT-46-v1.0 mejora consistentemente la calidad de la traducción en comparación con su contraparte SFT.
- Supera a las bases abiertas sólidas, incluyendo Seed-X, HY-MT2 y TranslateGemma.
- El modelo alcanza puntuaciones líderes sin referencia frente a sistemas propietarios como Google Translate, Gemini 3 Pro y GPT-5.
- Se investigó la destilación on-policy, pero no superó la frontera de calidad lograda por el aprendizaje por refuerzo con interpolación de puntos de control.
Los autores publican los modelos y el código para facilitar futuras investigaciones en este área.