Z.ai 发布了 GLM-5.3,这是一个专注于编码和网络安全模型,基于其 743B 基础模型的 post-training(后训练)构建,而非新的 pretraining(预训练)。发布内容包含具体的基准测试分数,如 Terminal Bench 3.0 为 28.3,DeepSWE 为 66.9。

Alibaba 发布了 Qwen3.8-27B,这是一个原生多模态密集模型,拥有 262K 上下文,可通过 YaRN 扩展至 1M,定位为在 17GB RAM 上本地使用。与此同时,Cursor 宣布加入 SpaceXAI,以参与 Grok 及相关产品的开发。

文章强调了中国实验室专注于 open-weight(开源权重)模型和 agent runtimes(智能体运行时)成为优化目标的趋势,以及对厂商基准测试声明的怀疑态度。