As notícias de IA desta semana destacam lançamentos significativos de modelos de pesos abertos da Z.ai, Tencent e Alibaba, além de avanços em infraestrutura de inferência e avaliação de agentes.

  • A Z.ai lançou o GLM-5.3 com 744B parâmetros totais para codificação agêntica e defesa cibernética, enquanto sua variante Flash oferece maior qualidade a menor custo.
  • A Tencent lançou o Hy4-preview, um modelo MoE de 770B que apresenta ganhos substanciais de desempenho sobre o Hy3 em tarefas de geração de código.
  • A Alibaba apresentou o Qwen3.8-Flash, um modelo MoE de 125B projetado para inferência multimodal de contexto longo e baixo custo, embora relatos iniciais notem problemas de estabilidade com a quantização FP8.
  • O vLLM publicou benchmarks comparando métodos de decodificação especulativa, não encontrando um vencedor universal e enfatizando o ajuste específico para cada carga de trabalho.
  • A Alibaba Accio disponibilizou como código aberto o CommerceAgentBench, um benchmark de 107 tarefas que mede a conclusão real de tarefas em vez de apenas a qualidade da resposta.
  • Pesquisas do Google indicam que habilidades portáteis armazenadas em uma wiki persistente transferem-se efetivamente entre famílias de modelos, potencialmente oferecendo capacidades de agente mais robustas do que o ajuste fino.