Claude Code v2.1.181 引入了通过 /config thinking=false 等提示语法设置配置的功能,增加了 macOS 上的沙盒 Apple Events 支持,并改进了流式传输、自动重试和子代理行为。此外,还修复了跨平台启动、文件处理、剪贴板和 UI 响应性方面的众多问题。
lab
Claude Code Releases
·
62 天前
·
agents
Claude Code v2.1.181 版本说明
译自 English → 中文
相关文章
arxiv
arXiv cs.CL
·
35 天前
·
3 次浏览
Claude Code 账单研究显示上下文缩减并不能降低成本
对 2,848 次由提供商计费的 Claude Code 运行的研究表明,减少检索到的上下文或工具输出并不能可靠地降低编码代理的实际计费成本。该研究通过分析跨越三个模型和七个存储库的 2,908 次执行活动,挑战了以文本移除为常见评估指标的做法。
media
r/LocalLLaMA
·
47 天前
·
10 次浏览
后续:DeepSeek V4 Flash在2x RTX PRO 6000上完成真实编码任务的速度快于Sonnet和Opus,质量约为Sonnet水平
一项后续基准测试评估了使用vLLM在两块RTX PRO 6000 GPU上运行的DeepSeek V4 Flash,将其在现实世界编码任务中的性能与Claude Sonnet和Opus等基于API的模型进行比较。研究发现,虽然Opus和Fable保持了更优的代码质量,但DeepSeek V4 Flash以显著更快的墙钟时间达到了约Sonnet级别的质量。
arxiv
arXiv cs.CL
·
47 天前
·
16 次浏览
TestEvo-Bench:用于测试与代码协同演化的可执行实时基准
作者介绍了 TestEvo-Bench,这是一个实时基准,旨在评估测试自动化代理处理代码和测试协同演化的能力。它通过提供锚定在真实提交历史和环境配置中的可执行任务,解决了现有基准的局限性。
lab
Claude Code Releases
·
7 小时前
·
2 次浏览
Claude Code v2.1.235 新增拼写检查,修复提示缓存和 UI 错误
Claude Code 版本 2.1.235 引入了可选的提示输入拼写检查功能,并解决了与提示缓存、UI 对齐以及权限对话框相关的多个问题。
media
Together AI Blog
·
19 小时前
·
16 次浏览
DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的对比:成本、编码与路由
在 DeepSWE 基准测试中对 DeepSeek V4 Pro 0813 和 Claude Fable 5 进行比较显示,使用这两种模型的路由策略以每个任务 8.28 美元的成本解决了 82.7% 的任务,优于单独使用 Fable(69.7%),且成本显著更低。