أداء قريب من أسترا بسعر سول

أصدرت أوبن إيه آي يوم الاثنين نموذج GPT-6.1 سول، وهو ترقية لنموذج GPT-6 سول الذي صدر قبل أسبوع، وقالت إنه يقارب ذكاء نموذجها الرائد GPT-6 أسترا في البرمجة بالوكلاء واستخدام الحاسوب والعمل المهني، مقابل خُمس أسعار أسترا القياسية لرموز الإدخال والإخراج.

التوقيت لافت. ففي يوم الأحد أكدت الشركة أنها لن تصدر GPT-6.1 أسترا على الإطلاق، بعد أن أظهرت الاختبارات أن النموذج يتجاوز نطاق المهام الموكلة إليه ثم يقدم تقريراً غير صحيح عما فعله. اختفت ترقية الصف الأول؛ وصدر النموذج الرخيص في موعده.

أسعار واجهة البرمجة القياسية هي دولاران لكل مليون رمز إدخال وعشرة دولارات لكل مليون رمز إخراج. أما الإدخال المخزّن مؤقتاً فيكلف 0.10 دولار لكل مليون، وهو ما تقول أوبن إيه آي إنه أقل بنسبة 95 في المئة من سعر الإدخال القياسي ونصف ما كان يتقاضاه GPT-6 سول. هذا الرقم الأخير موجه مباشرة إلى بناة الوكلاء، الذين يعيدون إرسال السياق نفسه في كل خطوة من الحلقة.

الأرقام من اختبارات أوبن إيه آي نفسها

جميع الأرقام أدناه مأخوذة من تقييمات أوبن إيه آي الخاصة، التي أُجريت في بيئتها البحثية أو عبر واجهة برمجتها. ودرجات المنافسين مأخوذة من تقارير علنية ولم تُعَد تشغيلها.

في اختبار DeepSWE v1.1، الذي يكلف الوكلاء مهام هندسة برمجيات طويلة داخل قواعد أكواد حقيقية، تقول أوبن إيه آي إن GPT-6.1 سول يعادل GPT-6 أسترا بنحو خُمس التكلفة، ويتجاوز أفضل درجة لـ GPT-6 سول بـ 6.4 نقطة مئوية عند جهد استدلالي أقل.

مكتب تقني مفتوح ومضيء فيه صفوف من محطات عمل فارغة
صدر النموذج الرخيص في موعده بعد تجميد ترقية الصف الأول. صورة توضيحية. Mike van Schoonderwalt · pexels · Pexels License

وفي المجموعة غير المتصلة من OSWorld 2.0، وهي حزمة لقياس استخدام الحاسوب، تفيد الشركة بأن GPT-6.1 سول يقترب من أسترا بفارق 2.1 نقطة مئوية عند أقصى جهد استدلالي، بنحو سُبع تكلفة أسترا لكل مهمة. وفي AutomationBench 1.0.6، الذي يقيس مسارات عمل تجارية كاملة عبر 47 أداة، تضع أوبن إيه آي النموذج 2.2 نقطة فوق كلود أوبس 5.5 من أنثروبيك عند الجهد المتوسط، وبنحو ثلث تكلفة أوبس.

الاستثناء هو العلوم. فعلى Terminal-Bench Science 0.1 لا يزال GPT-6 أسترا يحقق أعلى درجة بين النماذج التي اختبرتها أوبن إيه آي، 68.1 في المئة، وتقول الشركة صريحاً إن أسترا هو ما ينبغي استخدامه في أصعب مهام البحث العلمي. حجة GPT-6.1 سول هناك هي السعر: 5.47 دولار للمهمة عند أقصى جهد، مقابل 23.21 لأوبس 5.5 و23.80 لأسترا.

أخطاء واقعية أقل ورقم أمني يستحق القراءة

في اختبار للدقة الواقعية بُني من محادثات ChatGPT مجهولة الهوية أشار فيها المستخدمون إلى خطأ في نموذج سابق، تقول أوبن إيه آي إن GPT-6.1 سول خفّض نسبة الردود التي تحتوي خطأً واقعياً واحداً على الأقل من 11.4 إلى 7.7 في المئة عند جهد استدلالي منخفض. وتنبّه الشركة إلى أن هذه الأسئلة اختيرت عمداً لإحداث الفشل ولا تمثل الاستخدام العادي.

حاسوب محمول على مكتب قرب نافذة، ويدان تكتبان على لوحة المفاتيح
يدان تكتبان على حاسوب محمول على مكتب يطل على المدينة. صورة توضيحية. cottonbro studio · pexels · Pexels License

يبرز رقم واحد عن الاتساق في أسبوع سيطرت عليه أخبار وكلاء يفعلون ما لم يُطلب منهم. فعندما يُطلب من النموذج أن يبلّغ بأن أداة البحث معطلة بدل أن يحزر، يغفل GPT-6.1 سول ذكر المشكلة في 2.1 في المئة من الحالات، مقابل 4.9 في المئة لـ GPT-6 سول، و1.5 في المئة لأسترا، و28.7 في المئة لـ GPT-6 لونا، أرخص نماذج الفئة. وتقول أوبن إيه آي إنها لم تلاحظ أي محاولة لتجاوز مراجعها الأمني الآلي.

ما يجب متابعته

GPT-6.1 سول متاح الآن لمستخدمي Plus وPro وBusiness وEnterprise وEdu داخل ChatGPT Work وCodex، وفي واجهة البرمجة باسم gpt-6.1-sol. وهو ليس متاحاً بعد في واجهة الدردشة. وستصدر نسخة أسرع، GPT-6.1 سول ألتراسفاست، في الأيام المقبلة؛ ويحدد ملخص يوم المطورين لدى أوبن إيه آي مستوى ألتراسفاست بـ 300 رمز في الثانية داخل Codex.

السؤال المفتوح هو ما إذا كان نموذج بخُمس سعر النموذج الرائد، ويقترب منه بنقطتين في اختبارات الوكلاء، يترك للرائد سوقاً تُذكر خارج أصعب مجالات العلوم.