As notícias de IA desta semana destacam lançamentos significativos de modelos de pesos abertos da Z.ai, Tencent e Alibaba, além de avanços em infraestrutura de inferência e avaliação de agentes.
- A Z.ai lançou o GLM-5.3 com 744B parâmetros totais para codificação agêntica e defesa cibernética, enquanto sua variante Flash oferece maior qualidade a menor custo.
- A Tencent lançou o Hy4-preview, um modelo MoE de 770B que apresenta ganhos substanciais de desempenho sobre o Hy3 em tarefas de geração de código.
- A Alibaba apresentou o Qwen3.8-Flash, um modelo MoE de 125B projetado para inferência multimodal de contexto longo e baixo custo, embora relatos iniciais notem problemas de estabilidade com a quantização FP8.
- O vLLM publicou benchmarks comparando métodos de decodificação especulativa, não encontrando um vencedor universal e enfatizando o ajuste específico para cada carga de trabalho.
- A Alibaba Accio disponibilizou como código aberto o CommerceAgentBench, um benchmark de 107 tarefas que mede a conclusão real de tarefas em vez de apenas a qualidade da resposta.
- Pesquisas do Google indicam que habilidades portáteis armazenadas em uma wiki persistente transferem-se efetivamente entre famílias de modelos, potencialmente oferecendo capacidades de agente mais robustas do que o ajuste fino.