Anthropic ने Claude 3.7 Sonnet जारी किया है, जो केवल बेंचमार्क अनुकूलन के बजाय वास्तविक-दुनिया के व्यापार और डेवलपर उपयोग मामलों के लिए डिज़ाइन किया गया एक मॉडल है। इस रिलीज में मानक और उन्नत तर्क मोड के बीच गतिशील रूप से स्विच करने की क्षमता शामिल है, जिससे उपयोगकर्ता "सोचने के समय" के लिए आवंटित टोकन की संख्या को नियंत्रित कर सकते हैं।
- मूल्य निर्धारण $3/M इनपुट टोकन और $15/M आउटपुट टोकन पर निर्धारित है, जो इसे OpenAI के o1 और DeepSeek R1 के बीच स्थित करता है।
- इस मॉडल में एक हाइब्रिड आर्किटेक्चर है जो मानक मोड में ~200 ms लेटेंसी और विस्तारित सोचने के मोड में 15 सेकन तक प्रदान करता है।
- बेंचमार्क ग्रेजुएट-स्तर की तर्कशक्ति (GPQA Diamond: 78.2% / 84.8%) और कोडिंग (SWE-bench: 62.3% / 70.3%) में मजबूत प्रदर्शन दिखाते हैं, हालांकि यह हाई स्कूल गणित प्रतियोगिता स्कोर के साथ संघर्ष करता है।
- स्वतंत्र मूल्यांकन संकेत देते हैं कि परीक्षण किए गए किसी भी मॉडल, जिसमें Claude 3.7 Sonnet भी शामिल है, जटिल गणितीय समस्याओं के लिए विश्वसनीय नहीं हैं, और SAT-शैली प्रश्नों पर सभी सिक्का उछाल स्तर के आसपास स्कोर करते हैं।
कॉन्फ़िगर करने योग्य लेटेंसी और टोकन बजट नियंत्रण डेवलपर्स को अलग-अलग कार्यों के लिए अलग मॉडल की आवश्यकता के बिना गति और सटीकता के बीच संतुलन बनाने के लिए लचीलापन प्रदान करते हैं।