A Tencent lançou a família de modelos de tradução multilíngue "de raciocínio rápido" Hy-MT2, incluindo tamanhos de 1.8B, 7B e 30B-A3B (MoE), juntamente com o benchmark IFMTBench para avaliar capacidades de seguimento de instruções.
- Os modelos suportam tradução entre 33 idiomas e seguem efetivamente instruções em múltiplos idiomas.
- A quantização extrema AngelSlim de 1.25 bits reduz a exigência de armazenamento do modelo 1.8B para 440 MB e melhora a velocidade de inferência em 1,5x.
- As avaliações mostram que os modelos 7B e 30B-A3B superam modelos de código aberto como DeepSeek-V4-Pro e Kimi K2.6 no modo de raciocínio rápido, enquanto o modelo 1.8B supera APIs comerciais principais da Microsoft e Doubao.
- O lançamento inclui um pipeline completo de treinamento que suporta ajuste fino de parâmetros completos, LoRA e configurações DeepSpeed ZeRO.
Os modelos estão agora disponíveis no HuggingFace e ModelScope, com a Tencent parceira do WMT26 para a "Tarefa de Tradução de Legendas em Vídeo" para incentivar a participação da comunidade.