मध्यम कीमत, शीर्ष स्तर का अंक

Anthropic ने सोमवार को Claude Sonnet 5.5 जारी किया, अपने प्रमुख मॉडल Opus 5.5 के छह दिन बाद, और कंपनी के अपने आँकड़े सस्ते मॉडल को महँगे मॉडल से केवल दो अंक पीछे रखते हैं, उस मूल्यांकन पर जिसे कंपनी सामान्य ज्ञान-कार्य के लिए इस्तेमाल करती है। GDPval-AA v2.1 पर Anthropic Sonnet 5.5 को 1,844 और Opus 5.5 को 1,846 बताता है।

प्रति टोकन कीमत नहीं बदली है। Sonnet 5.5 की कीमत प्रति दस लाख इनपुट टोकन 2 डॉलर और प्रति दस लाख आउटपुट टोकन 10 डॉलर है, यानी Sonnet 5 के बराबर और Opus 5.5 से आधी। कैश पढ़ने की कीमत प्रति दस लाख 0.20 डॉलर पर बनी हुई है। Anthropic का तर्क दर के बारे में नहीं, कुल बिल के बारे में है: कंपनी कहती है कि मॉडल 30 प्रतिशत से अधिक तेज़ी से उत्तर देता है और एक कार्य 30 प्रतिशत तक सस्ते में पूरा करता है, क्योंकि वह रास्ते में कम टोकन खर्च करता है और कम टूल-कॉल करता है।

कोडिंग के आँकड़े बहुत आगे बढ़े

Terminal-Bench 4.0 पर, जो एजेंट-आधारित कोडिंग का मूल्यांकन है, Anthropic Sonnet 5.5 के लिए 70.6 प्रतिशत और Sonnet 5 के लिए 10.3 प्रतिशत बताता है — यह अंतर नए मॉडल के बारे में जितना कहता है, उतना ही इस बारे में भी कि पुराना मॉडल उस विशेष ढाँचे में कितना खराब चलता था। CursorBench 4.0 पर आँकड़ा 34.1 से 55.5 प्रतिशत हो गया, जहाँ Opus 5.5 57.8 पर है। FrontierCode 1.1 पर 42.4 से 46.2 प्रतिशत, जहाँ Opus 5.5 अभी भी 54.4 के साथ आगे है। कंप्यूटर चलाने की परीक्षा OSWorld 2.1 पर Sonnet 5.5 80.1 प्रतिशत और Opus 5.5 81.8 प्रतिशत बताता है।

रैक में लगे नेटवर्क स्विच के पोर्ट और उनमें जुड़ी पैच केबलें
इन्फ़रेंस की लागत ही मॉडल के लिए Anthropic का तर्क है। स्टॉक तस्वीर, Anthropic के डेटा सेंटर की नहीं। Vladimir Srajber · pexels · Pexels License

ये सभी आँकड़े Anthropic के अपने हैं, मॉडल के साथ प्रकाशित, किसी बाहरी मूल्यांकनकर्ता द्वारा तैयार नहीं। इनमें से किसी की भी स्वतंत्र रूप से पुष्टि अभी नहीं हुई है।

Anthropic जिन ग्राहकों का हवाला देता है, वे यही सुधार अपने शब्दों में बताते हैं। Box के एआई उपाध्यक्ष ने कहा कि मॉडल 2.4 गुना तेज़ था और कुल 12 प्रतिशत कम टोकन इस्तेमाल करता था। Slack ने लगभग 14 प्रतिशत कम आउटपुट टोकन बताए। Lovable, जिसका वार्षिक राजस्व इस महीने 60 करोड़ डॉलर पार कर गया, ने कहा कि उसके कोडिंग एजेंट को काम पूरा करने के लिए लगभग एक-तिहाई कम टूल-कॉल चाहिए थे। Zendesk ने कहा कि सहायता टिकट 20 प्रतिशत तेज़ी से निपटाए गए।

प्रमुख मॉडल से उधार लिए गए सुरक्षा उपाय

Sonnet 5.5 पहला Sonnet मॉडल है जो ऐसे वर्गीकारकों के साथ आता है जिनका उद्देश्य किसी को उसका तर्क निकालकर प्रतिद्वंद्वी मॉडल प्रशिक्षित करने से रोकना है — यह डिस्टिलेशन-रोधी बचाव Anthropic पहले अपने सबसे बड़े मॉडलों के लिए रखता था। इसके साइबर सुरक्षा उपाय Opus 5.5 के स्तर पर सेट हैं, और Anthropic कहता है कि अधिक जोखिम वाले अनुरोध नए मॉडल से उत्तर पाने के बजाय Sonnet 5 को भेज दिए जाते हैं। स्वीकृत रक्षकों को Cyber Verification Program के ज़रिए सीमित क्षमता तक पहुँच के लिए आवेदन करना होता है।

दफ़्तर में एक बड़ी स्क्रीन पर कोड देखते हुए दो सहकर्मी
Anthropic का कहना है कि मॉडल कम टोकन और कम टूल-कॉल में काम पूरा करता है। स्टॉक तस्वीर। Mikhail Nilov · pexels · Pexels License

एक सस्ते मॉडल के लिए यह सतर्क रुख है, और यह उस महीने में आया है जब अग्रणी प्रणालियों पर चलने वाले एजेंट बिना कहे सरकारी पोर्टलों और सार्वजनिक कोड रजिस्ट्रियों तक पहुँच चुके हैं।

आगे क्या देखना है

मॉडल Claude प्लेटफ़ॉर्म पर तथा AWS, Google Cloud और Microsoft Azure पर claude-sonnet-5-5 के नाम से उपलब्ध है। जिन आँकड़ों का इंतज़ार करना चाहिए, वे स्वतंत्र आँकड़े हैं। प्रति कार्य लागत के बारे में Anthropic का दावा इस पर टिका है कि मॉडल कम काम करने का चुनाव करे, और यही वह व्यवहार है जो किसी विक्रेता के ढाँचे और किसी ग्राहक के कोड के बीच सबसे अधिक बदलता है। सार्वजनिक कोडिंग तालिकाएँ और बुद्धि सूचकांक कुछ ही दिनों में इस अंतर पर संख्या रख देंगे।