Anthropic推出了Claude 3.5 Haiku以及升级版的Claude 3.5 Sonnet,在推理、编码和视觉处理能力方面取得进展。升级版Sonnet模型最显著的增强是其能够解读GUI截图并生成工具调用以自主执行任务。

  • 使用仅截图输入,升级版Claude 3.5 Sonnet在OSWorld基准测试中达到14.9%的业界平均成功率,随着交互步骤增加可提升至22%。
  • 新版Claude 3.5 Haiku模型在推理和指令遵循方面表现强劲,其性能常与原版Claude 3.5 Sonnet及Claude 3 Opus相当。
  • 两款模型均经过广泛的安全评估,包括针对计算机使用风险的 multimodal red-teaming,以及由美国和英国AI安全研究所进行的联合部署前测试。
  • 升级版Claude 3.5 Sonnet的知识截止日期为2024年4月,而Claude 3.5 Haiku的截止日期为2024年7月。

这些更新通过计算机使用功能增强了用户的自动化能力并改进了智能体任务完成度,同时保持符合Anthropic负责任扩展政策的严格安全标准。