Z.ai首席执行官唐杰认为,参数量不足以评估模型,并提出一种基于数据、计算分配和推理条件的新缩放定律。该框架支撑了GLM 5.3的开发,后者通过在通过递归自我改进管道合成的长视界环境上进行强化学习,实现了显著的性能提升。
- Ornith-1.5以开放权重家族形式上线(9B密集、35B MoE、397B MoE),具备端到端自我改进能力和强大的智能体基准测试表现。
- UnslothAI使用Dynamic V3发布Qwen3.8-27B GGUF格式模型,声称在相同参数量下准确率提升10%,且在8GB RAM上1-bit量化可保留BF16准确率的77%。
- GLM 5.3在Terminal Bench中排名第2,在法律基准测试中排名第3(开放权重模型类别),而Claude Opus 5在Agent Arena中领先质量表现。
这些进展凸显了评估方式正转向通过复杂、可执行的任务来衡量模型效用,而非依赖静态参数指标。