Anthropic发布了Claude 3模型卡的附录,详细介绍了Claude 3.5 Sonnet。这是一款在速度和成本上优于Claude 3 Opus的新模型,同时在编码和视觉处理方面提供了增强的能力。

  • Claude 3.5 Sonnet在研究生级科学(GPQA)、通用推理(MMLU)和编码熟练度(HumanEval)方面树立了新的性能标准。
  • 它在MathVista、ChartQA和DocVQA等五个视觉基准测试中取得了最先进的结果。
  • 在内部代理式编码评估中,该模型解决了64%的问题,而Claude 3 Opus仅解决38%。
  • 人类反馈评估显示,在编码、文档和创意写作等核心能力方面,其胜率显著高于Claude 3 Opus。
  • 附录还报告了Wildchat和XSTest数据集上拒绝率的改善,以及在高达200k token的Haystack Needle测试中近乎完美的召回率。