本周的AI新闻突出了来自Z.ai、腾讯和阿里巴巴的重大开源权重模型发布,以及推理基础设施和智能体基准测试方面的发展。

  • Z.ai发布了具有744B总参数的GLM-5.3,用于智能体编码和网络防御,而其Flash变体以更低成本提供更高品质。
  • 腾讯推出了Hy4-preview,这是一个770B的MoE模型,在代码生成任务中相比Hy3显示出显著的性能提升。
  • 阿里巴巴推出了Qwen3.8-Flash,这是一个125B的MoE模型,旨在实现低成本、长上下文的多模态推理,尽管早期报告指出FP8量化存在稳定性问题。
  • vLLM发布了比较推测解码方法的基准测试,发现没有通用的赢家,并强调针对特定工作负载进行调整。
  • 阿里巴巴Accio开源了CommerceAgentBench,这是一个包含107个任务的基准测试,用于衡量实际任务完成情况,而不仅仅是答案质量。
  • Google的研究表明,存储在持久化Wiki中的可移植技能能够有效地跨模型家族转移,可能提供比微调更强大的智能体能力。