मध्यम कीमत, शीर्ष स्तर का अंक
Anthropic ने सोमवार को Claude Sonnet 5.5 जारी किया, अपने प्रमुख मॉडल Opus 5.5 के छह दिन बाद, और कंपनी के अपने आँकड़े सस्ते मॉडल को महँगे मॉडल से केवल दो अंक पीछे रखते हैं, उस मूल्यांकन पर जिसे कंपनी सामान्य ज्ञान-कार्य के लिए इस्तेमाल करती है। GDPval-AA v2.1 पर Anthropic Sonnet 5.5 को 1,844 और Opus 5.5 को 1,846 बताता है।
प्रति टोकन कीमत नहीं बदली है। Sonnet 5.5 की कीमत प्रति दस लाख इनपुट टोकन 2 डॉलर और प्रति दस लाख आउटपुट टोकन 10 डॉलर है, यानी Sonnet 5 के बराबर और Opus 5.5 से आधी। कैश पढ़ने की कीमत प्रति दस लाख 0.20 डॉलर पर बनी हुई है। Anthropic का तर्क दर के बारे में नहीं, कुल बिल के बारे में है: कंपनी कहती है कि मॉडल 30 प्रतिशत से अधिक तेज़ी से उत्तर देता है और एक कार्य 30 प्रतिशत तक सस्ते में पूरा करता है, क्योंकि वह रास्ते में कम टोकन खर्च करता है और कम टूल-कॉल करता है।
कोडिंग के आँकड़े बहुत आगे बढ़े
Terminal-Bench 4.0 पर, जो एजेंट-आधारित कोडिंग का मूल्यांकन है, Anthropic Sonnet 5.5 के लिए 70.6 प्रतिशत और Sonnet 5 के लिए 10.3 प्रतिशत बताता है — यह अंतर नए मॉडल के बारे में जितना कहता है, उतना ही इस बारे में भी कि पुराना मॉडल उस विशेष ढाँचे में कितना खराब चलता था। CursorBench 4.0 पर आँकड़ा 34.1 से 55.5 प्रतिशत हो गया, जहाँ Opus 5.5 57.8 पर है। FrontierCode 1.1 पर 42.4 से 46.2 प्रतिशत, जहाँ Opus 5.5 अभी भी 54.4 के साथ आगे है। कंप्यूटर चलाने की परीक्षा OSWorld 2.1 पर Sonnet 5.5 80.1 प्रतिशत और Opus 5.5 81.8 प्रतिशत बताता है।

ये सभी आँकड़े Anthropic के अपने हैं, मॉडल के साथ प्रकाशित, किसी बाहरी मूल्यांकनकर्ता द्वारा तैयार नहीं। इनमें से किसी की भी स्वतंत्र रूप से पुष्टि अभी नहीं हुई है।
Anthropic जिन ग्राहकों का हवाला देता है, वे यही सुधार अपने शब्दों में बताते हैं। Box के एआई उपाध्यक्ष ने कहा कि मॉडल 2.4 गुना तेज़ था और कुल 12 प्रतिशत कम टोकन इस्तेमाल करता था। Slack ने लगभग 14 प्रतिशत कम आउटपुट टोकन बताए। Lovable, जिसका वार्षिक राजस्व इस महीने 60 करोड़ डॉलर पार कर गया, ने कहा कि उसके कोडिंग एजेंट को काम पूरा करने के लिए लगभग एक-तिहाई कम टूल-कॉल चाहिए थे। Zendesk ने कहा कि सहायता टिकट 20 प्रतिशत तेज़ी से निपटाए गए।
प्रमुख मॉडल से उधार लिए गए सुरक्षा उपाय
Sonnet 5.5 पहला Sonnet मॉडल है जो ऐसे वर्गीकारकों के साथ आता है जिनका उद्देश्य किसी को उसका तर्क निकालकर प्रतिद्वंद्वी मॉडल प्रशिक्षित करने से रोकना है — यह डिस्टिलेशन-रोधी बचाव Anthropic पहले अपने सबसे बड़े मॉडलों के लिए रखता था। इसके साइबर सुरक्षा उपाय Opus 5.5 के स्तर पर सेट हैं, और Anthropic कहता है कि अधिक जोखिम वाले अनुरोध नए मॉडल से उत्तर पाने के बजाय Sonnet 5 को भेज दिए जाते हैं। स्वीकृत रक्षकों को Cyber Verification Program के ज़रिए सीमित क्षमता तक पहुँच के लिए आवेदन करना होता है।

एक सस्ते मॉडल के लिए यह सतर्क रुख है, और यह उस महीने में आया है जब अग्रणी प्रणालियों पर चलने वाले एजेंट बिना कहे सरकारी पोर्टलों और सार्वजनिक कोड रजिस्ट्रियों तक पहुँच चुके हैं।
आगे क्या देखना है
मॉडल Claude प्लेटफ़ॉर्म पर तथा AWS, Google Cloud और Microsoft Azure पर claude-sonnet-5-5 के नाम से उपलब्ध है। जिन आँकड़ों का इंतज़ार करना चाहिए, वे स्वतंत्र आँकड़े हैं। प्रति कार्य लागत के बारे में Anthropic का दावा इस पर टिका है कि मॉडल कम काम करने का चुनाव करे, और यही वह व्यवहार है जो किसी विक्रेता के ढाँचे और किसी ग्राहक के कोड के बीच सबसे अधिक बदलता है। सार्वजनिक कोडिंग तालिकाएँ और बुद्धि सूचकांक कुछ ही दिनों में इस अंतर पर संख्या रख देंगे।