Claude Code v2.1.181은 /config thinking=false와 같은 프롬프트 구문을 통해 구성 설정을 지정하는 기능을 지원하고, macOS에서 샌드박스 Apple Events 지원을 추가하며, 스트리밍, 자동 재시도 및 서브에이전트 동작을 개선했습니다. 또한 여러 플랫폼에서 시작, 파일 처리, 클립보드 및 UI 응답성과 관련된 수많은 버그를 수정했습니다.
Claude Code v2.1.181 릴리스 노트
Claude Code 청구 연구: 컨텍스트 감소가 비용을 낮추지 않음을 보여줌
2,848건의 제공자 청구된 Claude Code 실행에 대한 연구는 검색된 컨텍스트나 도구 출력을 줄이는 것이 코딩 에이전트의 실제 청구 비용을 reliably 낮추지 않는다는 것을 드러냅니다. 이 연구는 세 모델과 일곱 저장소에서 2,908개의 실행 캠페인을 분석함으로써 텍스트 제거라는 일반적인 평가 지표에 의문을 제기합니다.
후속: RTX PRO 6000 2개에서 실행되는 DeepSeek V4 Flash는 Sonnet 및 Opus보다 실제 코딩 작업을 더 빠르게 처리하며, 품질은 Sonnet 수준에 근접
후속 벤치마크는 vLLM을 사용하여 두 개의 RTX PRO 6000 GPU에서 실행되는 DeepSeek V4 Flash의 성능을 Claude Sonnet 및 Opus와 같은 API 기반 모델과의 실제 코딩 작업 대비 비교합니다. 연구 결과, Opus와 Fable이 더 우수한 코드 품질을 유지하는 반면, DeepSeek V4 Flash는 현저히 짧은 실제 소요 시간으로 Sonnet 수준의 품질에 근접함을 보여줍니다.
TestEvo-Bench: 테스트와 코드 공동 진화를 위한 실행 가능하고 실시간 벤치마크
저자들은 TestEvo-Bench를 소개합니다. 이는 테스트 자동화 에이전트가 코드와 테스트의 공동 진화를 얼마나 잘 처리하는지 평가하기 위해 설계된 실시간 벤치마크입니다. 환경 구성이 포함된 실제 커밋 이력에 기반한 실행 가능한 작업을 제공함으로써 기존 벤치마크의 한계를 해결합니다.
Claude Code v2.1.235 맞춤법 검사 추가, 프롬프트 캐시 및 UI 버그 수정
Claude Code 버전 2.1.235는 프롬프트 입력을 위한 선택형 맞춤법 검사 기능을 도입하고, 프롬프트 캐싱, UI 정렬, 권한 대화상자와 관련된 여러 문제를 해결했습니다.
DeepSWE에서 DeepSeek V4 Pro 0813 대 Claude Fable 5: 비용, 코딩, 라우팅
DeepSWE 벤치마크에서 DeepSeek V4 Pro 0813과 Claude Fable 5를 비교한 결과, 두 모델을 모두 사용하는 라우팅 전략은 각각 $8.28의 비용으로 작업의 82.7%를 해결하여 Fable 단독(69.7%)보다 우수하며 비용이 훨씬 저렴합니다.