سعر الفئة المتوسطة ونتيجة الفئة العليا
أصدرت Anthropic يوم الاثنين نموذج Claude Sonnet 5.5، بعد ستة أيام من نموذجها الرائد Opus 5.5، وأرقام الشركة نفسها تضع النموذج الأرخص نقطتين فقط خلف النموذج الأغلى في التقييم الذي تستخدمه للعمل المعرفي العام. في اختبار GDPval-AA الإصدار 2.1، تذكر Anthropic 1844 لـ Sonnet 5.5 مقابل 1846 لـ Opus 5.5.
لم يتغير السعر لكل توكن. يكلف Sonnet 5.5 دولارين لكل مليون توكن مُدخل وعشرة دولارات لكل مليون توكن مُخرج، وهو السعر نفسه لـ Sonnet 5 ونصف ما يتقاضاه Opus 5.5. تبقى قراءات الذاكرة المؤقتة عند 0.20 دولار لكل مليون. حجة Anthropic تتعلق بالفاتورة الإجمالية لا بالتسعيرة: تقول الشركة إن النموذج ينتج مخرجاته بسرعة أكبر بأكثر من 30 بالمئة وينهي المهمة بتكلفة أقل تصل إلى 30 بالمئة، لأنه يستهلك توكنات أقل ويستدعي أدوات أقل في الطريق.
أرقام البرمجة تتحرك كثيرا
في اختبار Terminal-Bench 4.0 للبرمجة بالوكلاء، تذكر Anthropic 70.6 بالمئة لـ Sonnet 5.5 مقابل 10.3 بالمئة لـ Sonnet 5، وهي فجوة تقول عن سوء أداء النموذج الأقدم في ذلك الإطار بعينه قدر ما تقول عن الجديد. في CursorBench 4.0 ترتفع النتيجة من 34.1 إلى 55.5 بالمئة، مع Opus 5.5 عند 57.8. وفي FrontierCode 1.1 تنتقل من 42.4 إلى 46.2 بالمئة، حيث يتقدم Opus 5.5 بـ 54.4. وفي OSWorld 2.1، اختبار استخدام الحاسوب، تذكر Anthropic 80.1 بالمئة لـ Sonnet 5.5 مقابل 81.8 لـ Opus 5.5.

كل هذه الأرقام من Anthropic نفسها، نُشرت مع النموذج ولم يصدرها مُقيّم خارجي. ولم يُعَد إنتاج أي منها بشكل مستقل حتى الآن.
العملاء الذين تنقل عنهم Anthropic يصفون التحسن نفسه بكلماتهم. قال نائب رئيس الذكاء الاصطناعي في Box إن النموذج كان أسرع 2.4 مرة واستخدم توكنات أقل بنسبة 12 بالمئة في المجموع. وأفاد Slack بانخفاض توكنات الإخراج بنحو 14 بالمئة. وقالت Lovable، التي تجاوزت إيراداتها السنوية 600 مليون دولار هذا الشهر، إن وكيل البرمجة لديها احتاج إلى استدعاءات أدوات أقل بنحو الثلث لإنجاز المهمة. وقالت Zendesk إن تذاكر الدعم عُوملت أسرع بنسبة 20 بالمئة.
ضمانات مستعارة من النموذج الرائد
Sonnet 5.5 هو أول نموذج Sonnet يصل مع مصنِّفات تهدف إلى منع أي شخص من استخراج استدلاله لتدريب منافس، وهو دفاع ضد التقطير كانت Anthropic تحفظه حتى الآن لأكبر نماذجها. ضمانات الأمن السيبراني فيه مضبوطة على مستوى Opus 5.5، وتقول Anthropic إن الطلبات الأعلى خطورة تُحوَّل إلى Sonnet 5 بدل أن يجيب عنها النموذج الجديد. ويمكن للمدافعين المعتمدين التقدم للحصول على القدرة المقيدة عبر برنامج Cyber Verification Program.

هذا موقف حذر بالنسبة لنموذج رخيص، ويأتي في شهر وصل فيه وكلاء يعملون على أنظمة متقدمة إلى بوابات حكومية عامة وسجلات برمجية دون أن يطلب منهم أحد ذلك.
ما ينبغي متابعته
النموذج متاح على منصة Claude وعلى AWS وGoogle Cloud وMicrosoft Azure باسم claude-sonnet-5-5. الأرقام التي تستحق الانتظار هي الأرقام المستقلة. فادعاء Anthropic بشأن التكلفة لكل مهمة يستند إلى أن النموذج يختار القيام بعمل أقل، وهذا بالضبط هو السلوك الذي يتفاوت أكثر من غيره بين إطار المزوّد وقاعدة أكواد العميل. وستضع جداول البرمجة العامة ومؤشرات الذكاء رقما على الفارق في غضون أيام.