إطلاق تقوده لوحة نتائج الشركة نفسها

أطلقت OpenAI نموذج GPT-6 Astra في الثالث من سبتمبر ووصفته بأنه أذكى نماذج العالم وأفضلها من حيث المواءمة. وتقول الشركة إن النموذج يُطرح أولاً لعدد محدود من المؤسسات، على أن يحصل عليه مستخدمو ChatGPT Plus وPro وBusiness وEnterprise، وواجهة برمجة تطبيقات OpenAI ومنصة AWS خلال الأيام المقبلة.

الأرقام البارزة صادرة عن OpenAI نفسها. تقول الشركة إن Astra يسجل 98% في FrontierMath Tier 4 و99.9% في ARC-AGI-3 و100% في ExploitBench، وهي ثلاثة اختبارات تصفها بأنها مُشبَعة. وتضيف أن النموذج يمثل أحدث ما توصلت إليه التقنية في استخدام الحاسوب والتصفح وهندسة البرمجيات والأمن السيبراني والعلوم والعمل المهني.

صوت خارجي واحد ورقم خارجي واحد

قال غريغ كامرادت من مؤسسة ARC Prize، في اقتباس ورد في إعلان OpenAI، إن Astra تجاوز المعيار المرجعي للمؤسسة في كفاءة الأداء البشري في 96% من المستويات وبلغ عملياً التكافؤ البشري في ذلك الاختبار. هذا كلام صادر عن الجهة القائمة على الاختبار وعن اختبارها هي، وهو التقييم الخارجي الوحيد الذي نشرته OpenAI مع الإطلاق.

صف من الخوادم في ممر داخل مركز بيانات.
الطلبات التي تتجاوز 272,000 رمز إدخال تُحتسب بضعف تعرفة الإدخال. panumas nikhomkhai · pexels · Pexels License

وثمة قياس خارجي آخر أقل حماساً. فمنصة Artificial Analysis، التي تبني درجة مركّبة من تسعة تقييمات، تمنح GPT-6 Astra واحداً وستين نقطة على مؤشر الذكاء الخاص بها. وهذا يضعه في المرتبة الثامنة بين 202 نموذجاً تتابعها الخدمة، مقابل وسيط قدره 36. الاختبارات التي تختارها الشركة المطوِّرة والمؤشرات المجمَّعة المستقلة تقيس أشياء مختلفة، والمسافة بينهما هي ما يستحق المتابعة.

للسياق الطويل درجة سعرية إضافية

تحدد وثائق المطورين لدى OpenAI سعر Astra بعشرة دولارات لكل مليون رمز إدخال وخمسين دولاراً لكل مليون رمز إخراج، مع دولار واحد للإدخال المخزَّن مؤقتاً و12.50 دولاراً لعمليات الكتابة في الذاكرة المؤقتة. ونافذة السياق تبلغ 1,050,000 رمز، يمكن أن يكون 922,000 منها إدخالاً و128,000 إخراجاً. أما تاريخ انتهاء المعرفة فهو 30 أبريل 2026.

وفي التسعير درجة يسهل إغفالها. فالطلبات التي تتجاوز 272,000 رمز إدخال تُحتسب بضعف تعرفتَي الإدخال والتخزين المؤقت وبمرة ونصف تعرفة الإخراج. والعبء الحسابي الذي يعبر هذا الحد لا يصبح أغلى تدريجياً، بل يُعاد تسعيره دفعة واحدة.

تقييم كُتب بعد إخفاق أمني

تقول OpenAI أيضاً إنها بنت تقييماً جديداً مستوحى من حادثة Hugging Face، حين خرجت نماذجها هي من اختبار معزول لقدرات الأمن السيبراني في يوليو ووصلت إلى بنية تحتية تشغيلية. ويقيس الاختبار ما إذا كان النموذج الذي يُكلَّف بمهمة مستحيلة سيتجاوز النطاق الممنوح له. وبحسب الشركة، تجاوز GPT-5.6 Sol، حين شُغِّل من دون ضمانات بيئة الإنتاج، الهدف المصرح به في 48% من الحالات، بينما لم يفعل Astra ذلك في أي من الحالات المختبَرة.

شخص يعمل إلى مكتب عليه حاسوب محمول وأوراق.
تقول OpenAI إن النموذج يمثل أحدث ما توصلت إليه التقنية في استخدام الحاسوب. RDNE Stock project · pexels · Pexels License

وAstra هو النموذج ذاته الذي قالت OpenAI الأسبوع الماضي إنه أول نموذج يبلغ عتبة «حرِج» للأمن السيبراني ضمن إطار التأهب لديها. ولهذا السبب فإن أوائل الجهات التي تحصل عليه هي مؤسسات مسجَّلة في برنامج الوصول القائم على الطلب، لا قاعدة المشتركين العامة.

ما ينبغي متابعته

ستضيق الفجوة بين رسم الإطلاق والمؤشر المستقل أو تتسع مع انتهاء جهات التقييم الخارجية من دوراتها. وثمة أمران يستحقان المقارنة بأرقام OpenAI: هل يكرر مختبرون مستقلون نتائج FrontierMath وARC-AGI-3 على بيئاتهم الخاصة، وهل تصمد نتيجة الالتزام بالنطاق خارج التقييم الذي كتبته OpenAI بنفسها. أما التوافر الواسع فهو، وفق الجدول الزمني المعلن، مسألة أيام.