Los investigadores han desarrollado MiLMMT-46-v1.0, un modelo de traducción automática multilingüe que aplica postentrenamiento sin referencia a modelos de lenguaje grandes de código abierto. El equipo utiliza Optimización de Política Relativa por Grupos (GRPO) con una recompensa basada en dos modelos de estimación de calidad sin referencia, controlada por identificación de idioma.

  • Partiendo de los puntos de control MiLMMT-46-v0.1 ajustados supervisadamente, los autores aplican aprendizaje por refuerzo e interpolan linealmente los resultados para crear v1.0.
  • El modelo se evalúa en 46 idiomas y mejora consistentemente la calidad de la traducción en comparación con su contraparte de ajuste fino supervisado.
  • Supera a las bases de código abierto sólidas, incluyendo Seed-X, HY-MT2 y TranslateGemma.
  • Frente a sistemas propietarios como Google Translate, Gemini 3 Pro y GPT-5, alcanza puntuaciones líderes sin referencia.
  • Se investigó la destilación on-policy pero no superó el frente de calidad logrado por RL con interpolación de puntos de control.

Los autores liberan los modelos y el código para facilitar futuras investigaciones en este área.