Tencent ha lanzado la familia de modelos de traducción multilingüe "de pensamiento rápido" Hy-MT2, que incluye tamaños de 1.8B, 7B y 30B-A3B (MoE), junto con el benchmark IFMTBench para evaluar las capacidades de seguimiento de instrucciones.
- Los modelos admiten la traducción entre 33 idiomas y siguen eficazmente las instrucciones en múltiples idiomas.
- La cuantización extrema AngelSlim de 1.25 bits reduce el requisito de almacenamiento del modelo 1.8B a 440 MB y mejora la velocidad de inferencia en un 1.5x.
- Las evaluaciones muestran que los modelos 7B y 30B-A3B superan a los modelos de código abierto como DeepSeek-V4-Pro y Kimi K2.6 en modo de pensamiento rápido, mientras que el modelo 1.8B supera a las APIs comerciales principales de Microsoft y Doubao.
- El lanzamiento incluye una canalización completa de entrenamiento que admite ajuste fino con parámetros completos, LoRA y configuraciones de DeepSpeed ZeRO.
Los modelos ya están disponibles en HuggingFace y ModelScope, con Tencent asociándose con WMT26 para la "Tarea de Traducción de Subtítulos de Video" para fomentar la participación de la comunidad.