Anthropic宣布推出升级版Claude 3.5 Sonnet模型、全新轻量级模型Claude 3.5 Haiku,以及面向开发者的“计算机使用”能力公测版。
- 升级后的Claude 3.5 Sonnet在SWE-bench Verified上的得分从33.4%提升至49.0%,并在零售和航空领域的TAU-bench中表现提升,同时保持与前代相同的价格和速度。
- Claude 3.5 Haiku在许多智能基准测试中与Claude 3 Opus持平或超越,其速度与上一代Haiku相近,定价为每百万输入token 0.80美元,每百万输出token 4美元。
- “计算机使用”功能使Claude能够通过查看屏幕并执行点击和打字等命令与计算机界面交互;在仅依赖截图的OSWorld任务中得分14.9%,优于次优系统的7.8%。
- 新模型可通过Anthropic API、Amazon Bedrock和Google Cloud的Vertex AI获取,其中“计算机使用”功能目前处于实验性公测阶段,以收集开发者反馈。