Claude Code v2.1.181 memperkenalkan dukungan untuk mengatur pengaturan konfigurasi melalui sinteks prompt seperti /config thinking=false, menambahkan dukungan Apple Events sandbox di macOS, serta meningkatkan streaming, auto-retry, dan perilaku subagent. Ini juga memperbaiki banyak bug terkait startup, penanganan file, clipboard, dan responsivitas UI di berbagai platform.
Catatan Rilis Claude Code v2.1.181
Studi penagihan Claude Code menunjukkan pengurangan konteks tidak menurunkan biaya
Sebuah studi mengenai 2.848 eksekusi Claude Code yang ditagih oleh penyedia mengungkapkan bahwa mengurangi konteks yang diambil atau output alat tidak secara andal menurunkan biaya tagihan aktual agen pemrograman. Penelitian ini menantang metrik evaluasi umum penghapusan teks dengan menganalisis kampanye 2.908 eksekusi di tiga model dan tujuh repositori.
Tindak lanjut: DeepSeek V4 Flash di 2x RTX PRO 6000 menyelesaikan tugas coding nyata lebih cepat daripada Sonnet dan Opus, dengan kualitas sekitar setara Sonnet
Sebuah benchmark tindak lanjut mengevaluasi DeepSeek V4 Flash yang berjalan pada dua GPU RTX PRO 6000 menggunakan vLLM, membandingkan kinerjanya dalam tugas coding dunia nyata terhadap model berbasis API seperti Claude Sonnet dan Opus. Studi ini menemukan bahwa meskipun Opus dan Fable mempertahankan kualitas kode yang lebih unggul, DeepSeek V4 Flash mencapai kualitas sekitar setara Sonnet dengan waktu wall-clock yang jauh lebih cepat.
TestEvo-Bench: Benchmark Eksekutabel dan Langsung untuk Ko-Evolusi Tes dan Kode
Para penulis memperkenalkan TestEvo-Bench, sebuah benchmark langsung yang dirancang untuk mengevaluasi seberapa baik agen otomatisasi tes menangani ko-evolusi kode dan tes. Ini mengatasi keterbatasan dalam benchmark yang ada dengan menyediakan tugas-tugas eksekutabel yang berakar pada riwayat commit nyata dengan konfigurasi lingkungan.
Claude Code v2.1.235 menambahkan pemeriksaan ejaan, memperbaiki cache prompt dan bug UI
Claude Code versi 2.1.235 memperkenalkan fitur pemeriksaan ejaan opsional untuk input prompt serta menyelesaikan beberapa masalah dengan caching prompt, penjajaran UI, dan dialog izin.
DeepSeek V4 Pro 0813 vs Claude Fable 5 pada DeepSWE: Biaya, Pemrograman, dan Pengalihan
Perbandingan antara DeepSeek V4 Pro 0813 dan Claude Fable 5 pada benchmark DeepSWE mengungkapkan bahwa strategi pengalihan yang menggunakan kedua model menyelesaikan 82,7% tugas dengan biaya masing-masing $8,28, mengungguli penggunaan Fable saja (69,7%) sambil menjadi jauh lebih murah.