Claude Code v2.1.181は、/config thinking=false のようなプロンプト構文による設定値の変更に対応し、macOSでサンドボックスApple Eventsのサポートを追加しました。また、ストリーミング処理、自動リトライ、サブエージェントの動作を改善しています。さらに、プラットフォーム全体で起動時、ファイル処理、クリップボード、UIレスポンスに関連する多数のバグを修正しました。
Claude Code v2.1.181 リリースノート
Claude Codeの請求調査:コンテキスト削減がコストを下げないことを示す
2,848件のプロバイダ請求によるClaude Codeの実行に関する調査により、取得されたコンテキストやツール出力を削減しても、コーディングエージェントの実際の請求コストが確実に下がるわけではないことが明らかになった。この研究は、3つのモデルと7つのリポジトリにわたる2,908回の実行キャンペーンを分析することで、テキスト除去という一般的な評価指標に疑問を投げかける。
追跡レポート: DeepSeek V4 Flashを2枚のRTX PRO 6000で実行すると、SonnetやOpusよりもリアルなコーディングタスクが高速に完了し、品質はSonnetレベルに達する
DeepSeek V4 FlashをvLLMを用いて2枚のRTX PRO 6000 GPU上で動作させた追跡ベンチマークは、Claude SonnetやOpusなどのAPIベースモデルと比較して、現実的なコーディングタスクでのパフォーマンスを評価したものである。その結果、OpusとFableは優れたコード品質を維持しているものの、DeepSeek V4 FlashはSonnetレベルの品質を達成しつつ、大幅に短い実時間で処理を終了することが判明した。
TestEvo-Bench: テストとコードの共進化のための実行可能かつライブなベンチマーク
著者らは、テスト自動化エージェントがコードとテストの共進化をどの程度適切に処理できるかを評価するために設計されたライブベンチマークであるTestEvo-Benchを紹介します。既存のベンチマークの限界に対処し、実際のコミット履歴と環境設定に基づいた実行可能なタスクを提供します。
Claude Code v2.1.235がスペルチェックを追加し、プロンプトキャッシュとUIのバグを修正
Claude Code バージョン 2.1.235 は、プロンプト入力用のオプションのスペルチェック機能を紹介し、プロンプトキャッシュ、UI の整列、および権限ダイアログに関するいくつかの問題を解決しました。
DeepSWEにおけるDeepSeek V4 Pro 0813とClaude Fable 5の比較:コスト、コーディング、ルーティング
DeepSWEベンチマークにおけるDeepSeek V4 Pro 0813とClaude Fable 5の比較により、両方のモデルを使用するルーティング戦略は、各タスクあたり$8.28で82.7%のタスクを解決し、Fable単独(69.7%)を上回り、大幅に安価であることが示された。