GLM团队在z.ai的博客上发表了一篇文章,详细介绍了其推理基础设施的架构和设计。
- 该文章深入介绍了GLM如何处理模型服务和优化。
- 对于关注大型语言模型部署系统的人来说,这是一篇“非常有趣的读物”。
GLM团队在z.ai的博客上发表了一篇文章,详细介绍了其推理基础设施的架构和设计。
Z.ai发布了GLM-5.3-Flash,这是一个拥有320B参数、18B激活参数的多模态MoE模型;而阿里巴巴的Qwen团队则发布了Qwen3.8-Flash-Next,这是一个拥有125B参数、6B激活参数的模型。尽管是独立开发,但两个团队采用了几乎相同的架构配置。
对八项模型的研究表明,代理记忆并非通用特性,而是一种必须针对特定模型能力进行校准的剂量。ALTK-Evolve 框架从代理的历史轨迹中提取指导原则,并在推理阶段注入这些原则而无需更新权重,结果表明最优的记忆策略在不同模型层级之间存在显著差异。
llama.cpp 项目发布了构建版本 b10174,为 GLM_DSA (GLM-5.2) 模型架构引入了 NextN/MTP 推测解码支持。
PIVOT(Proxy Indexing Via One full-prefix Traversal)是一种无需训练、可即插即用的DeepSeek稀疏注意力(DSA)索引器替代方案,它通过在邻近查询组间共享单次前缀扫描来减少计算冗余。PIVOT不再为每个查询单独对每个前置令牌进行评分,而是将查询组聚合为一个代理查询以获取候选集,随后从中为每个查询选出top-k个令牌。
一位用户将 GLM-5.2 (753B MoE) 模型量化为 Int4-Int8Mix,并使用 NVFP4 4-bit KV 缓存,在四台 DGX Spark (GB10) 系统上运行,在 Terminal-Bench 2.1 中取得了 70.8% 的得分。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策