Terminal Bench 4.0 已发布,更新该基准测试以跟上新模型发布的步伐并应对基准测试饱和问题。

  • 更新包含性能数据,显示 GLM-5.3 在考虑误差范围的情况下与 Fable 5 处于同一水平。
  • 公告强调了对 TerminalBench 的快速迭代,以保持与新兴模型的竞争力。
  • 社区讨论突出了大型基准测试的高计算成本,指出每次运行需要 5-10B tokens。