يُقدم Claude Code v2.1.181 دعمًا لتعيين إعدادات التكوين عبر صيغة الأمر مثل /config thinking=false، ويضيف دعم أحداث Apple في البيئة المعزولة على نظام macOS، ويُحسّن التدفق المباشر، وإعادة المحاولة التلقائية، وسلوك الوكيل الفرعي. كما يُصلح العديد من الأخطاء المتعلقة بالبدء التشغيل، ومعالجة الملفات، والحافظة، واستجابة واجهة المستخدم عبر المنصات المختلفة.
ملاحظات إصدار Claude Code v2.1.181
تظهر دراسة فواتير Claude Code أن تقليل السياق لا يخفض التكاليف
تكشف دراسة لـ 2848 تشغيلًا لـ Claude Code تم فوترتها من قبل المزود عن أن تقليل السياق المسترجع أو مخرجات الأدوات لا يخفض بشكل موثوق التكلفة الفعلية المفروضة على وكلاء البرمجة. تتحدى الأبحاث مقياس التقييم الشائع المتمثل في إزالة النص من خلال تحليل حملة مكونة من 2908 تنفيذ عبر ثلاثة نماذج وسبعة مستودعات.
متابعة: DeepSeek V4 Flash على 2x RTX PRO 6000 ينجز مهام البرمجة الحقيقية أسرع من Sonnet و Opus، بجودة تقارب جودة Sonnet
تقوم متابعة للمعايير بتقييم أداء DeepSeek V4 Flash الذي يعمل على بطاقتي RTX PRO 6000 باستخدام vLLM، ومقارنة أدائه في مهام البرمجة الواقعية مع النماذج القائمة على واجهة برمجة التطبيقات مثل Claude Sonnet و Opus. وجدت الدراسة أنه بينما يحافظ Opus و Fable على جودة برمجية متفوقة، يحقق DeepSeek V4 Flash جودة تقارب مستوى Sonnet بأوقات تشغيل (wall-clock times) أسرع بكثير.
TestEvo-Bench: معيار قابل للتنفيذ ومباشر للتطور المشترك للاختبار والكود
يقدم المؤلفون TestEvo-Bench، وهو معيار مباشر مصمم لتقييم مدى قدرة وكلاء أتمتة الاختبارات على التعامل مع التطور المشترك للكود والاختبارات. يعالج هذه الأداة قيود المعايير الحالية من خلال توفير مهام قابلة للتنفيذ مرتبطة بتاريخ عمليات الدمج (commits) الحقيقية مع تكوينات البيئة.
إضافة ميزة التصحيح الإملائي وإصلاح أخطاء ذاكرة التخزين المؤقت للطلبات وواجهة المستخدم في Claude Code v2.1.235
أصدرت نسخة Claude Code الإصدار 2.1.235 ميزة تصحيح إملائي اختيارية لإدخال الطلب، وحلّت عدة مشكلات تتعلق بتخزين ذاكرة التخزين المؤقت للطلبات، ومحاذاة واجهة المستخدم، ونوافذ الأذونات.
DeepSeek V4 Pro 0813 مقابل Claude Fable 5 على DeepSWE: التكلفة، البرمجة، والتوجيه
يكشف مقارنة بين DeepSeek V4 Pro 0813 وClaude Fable 5 على معيار DeepSWE أن استراتيجية توجيه تستخدم كلا النموذجين تحل 82.7% من المهام بتكلفة 8.28 دولار لكل منهما، متفوقةً على استخدام Fable وحده (69.7%) وأرخص بكثير.