Anthropic 发布了 Claude Fable 5.1,这是一款在编码、知识工作和长周期问题解决任务中树立新标准的模型更新。此次发布突出了在新 Terminal-Bench-Science 0.1 基准测试中的显著性能提升,Fable 5.1 取得了 52.6% 的得分,而 Fable 5 为 24.7%,Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%。

  • Claude Fable 5.1 引入了五个推理级别:低、中、高、超高和最高,且无法完全禁用推理。
  • 在 pelican SVG 生成提示词上的测试显示,低和中努力级别完全跳过了推理轨迹,而更高级别则生成了详细的内部独白。
  • “最高”推理级别需要 65,927 个输出 token,任务成本为 $3.30,在所有测试模型中产生了最详细的视觉输出。
  • 使用“高”思考级别对生成的 SVG 进行动画处理花费了 $1.37,并生成了带有旋转车轮的视频,尽管方向不正确。

此次更新允许用户比较不同推理努力级别下的模型性能,揭示增加计算投入如何影响输出质量和细节。