14 अगस्त से Anthropic Claude Code के Pro, Max और Team प्लानों के लिए नए सत्रों में ऑटो मोड को डिफ़ॉल्ट सेटिंग बना रहा है। यह बदलाव कंपनी के उस विश्वास को दर्शाता है कि प्रॉम्प्ट इंजेक्शन और डेटा एक्सफिल्ट्रेशन जैसे जोखिमों को मानवीय समीक्षा की तुलना में अधिक प्रभावी ढंग से कम करने में इस सुविधा की क्षमता है।

  • 1,053 भुगतान किए गए परीक्षकों के एक नियंत्रित अध्ययन में पाया गया कि ऑटो मोड 89% हानिकारक कार्यों को रोक देता, जबकि मानवों द्वारा केवल 13.6% अस्वीकार किया गया।
  • Trajectory Labs ने Claude Fable 5, Opus 5 और Sonnet 5 पर ऑटो मोड चलाते हुए 720 अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन परिदृश्यों का मूल्यांकन किया।

तीसरे पक्ष के मूल्यांकन के दौरान निर्दिष्ट Claude मॉडलों के खिलाफ 720 हमले की कोशिशों में से कोई भी सफल नहीं हुई।

Anthropic इस बदलाव को महत्वपूर्ण मानता है क्योंकि पुष्टि थकान मानवीय समीक्षकों में असुरक्षित व्यवहार का कारण बनती है, जबकि ऑटो मोड दुर्भावनापूर्ण निर्देशों के संपर्क को काफी कम करता है।