llama.cpp 添加对 GLM-5.3-Flash 的支持,包含 k-pool 和 MTP 修复
llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
Anthropic的Frontier Red Team在内部Binary Exploitation基准测试的100项任务上评估了中国模型GLM-5.3,发现其在4%的试验中能够开发完全的控制流劫持。
Anthropic 发表了一篇题为《GLM-5.3 与高级网络能力的传播》的研究文章,探讨了 GLM-5 等开源模型如何被用于恶意网络活动。 文章指出,这些模型已被威胁行为者广泛采用,实际上在安全社区中起到了宣传其能力的作用。 这一分析强调了人们对先进 AI 模型双重用途性质及其放大网络威胁潜力的日益担忧。
Anthropic发表了一篇研究文章,考察了GLM-5.3及其在传播高级网络能力中的作用。
一项题为“多轮LLM污染中的认知策略分歧:一种协议梯度调查”的研究评估了大型语言模型如何处理注入对话历史中的错误前提,这种故障模式被称为会话级污染。研究人员在十个知识领域中对GPT-5.4 Mini、Gemini-3.1 Flash-Lite和GLM-4.5-Air进行了测试,共使用22,500个回合,温度为零。
研究人员推出了TelecomGPT-R1,这是一套开源的统一电信推理模型家族,旨在通过对标准、配置和日志进行推理来自动化工程任务。该模型通过涵盖协议、知识、建模和故障四个维度的结构化方法,克服了现有通用和专业大语言模型的局限性。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
智谱的官方 AI 编码桌面应用 ZCode 被发现会在用户登录时静默打包并上传用户的完整工作区。此过程包括加密数据并直接发送至阿里云 OSS。
GLM团队在z.ai的博客上发表了一篇文章,详细介绍了其推理基础设施的架构和设计。
一项研究对六个前沿语言模型在一个双智能体通信任务上进行了评估,其中提问方通过恰好 log2(N) 个是/否问题从 N 段维基百科段落中识别目标。实验在包含 4 到 1024 段文档的集合上运行了 408 场游戏,揭示了被测模型之间显著的性能差异。
Base-10的Charlie O'Neill在最近一期与Dwarkesh Patel合作的节目中讨论了为什么Kimi和GLM模型“几乎客观上”优于Opus 5。
InternLM推出了Intern-S2-397B,这是一个拥有3970亿参数的多模态基础模型,专为科学智能和长周期代理而设计。该模型在预训练、强化学习任务覆盖范围以及交互式代理环境方面进行了扩展,以增强通用推理能力和代理能力。
研究人员表明,方向消融(directional ablation)这一通过从权重中投影去除单一方向来移除拒绝行为的白盒攻击,在前沿混合专家(MoE)模型(如GLM-5.3-Flash)上仍然有效。研究表明,尽管该攻击能够穿透架构,但其影响分布在注意力层、密集层和路由专家写入器之间,而非集中在某一位置。