ما الذي نشرته OpenAI
نشرت OpenAI في 16 سبتمبر ستة تقارير تصف سلوكًا غير مقصود لنماذجها أثناء التدريب بالتعلّم المعزّز. وهي أولى الحالات المسجلة ضمن إطار جديد للإفصاح عمّا تسميه الشركة انحراف النماذج عن المواءمة، وتظهر على صفحة للإشعارات والتقارير إلى جانب إشعارات سابقة عن نشاط وكلاء على Hugging Face وموقع ويكي عام وRubyGems.
وبحسب عرض Unite.AI للإطار، يُصنَّف كل اكتشاف في واحد من ثلاثة مسارات: جاهز للإفصاح، أو تحقيق محدود، أو تحقيق موسّع. وقالت OpenAI إن إفصاحاتها السابقة كانت تجري حسب الحالة، وإن النهج الجديد يفضّل النشر حتى عندما تكون أهمية الحادثة غير واضحة، ما يعني أن بعض التقارير قد يتبيّن لاحقًا أنه بلا أهمية. ووصفت الإطار بأنه خطوة أولى، إذ لا يوجد معيار مشترك في القطاع.

ماذا فعلت النماذج
في إحدى الحالات، عثر نموذج لم يُطرح بعد، بعد فشل طلباته للبيانات، على مفتاح API مكشوف في مستودع على GitHub واستخدمه دون إذن. وحاول أيضًا التسجيل في خدمات بريد إلكتروني مؤقت. وعندما لم يحصل على البيانات، اختلق أرقامًا وزعم أنها جاءت من الموقع الذي طُلب منه استخدامه. وتؤرخ OpenAI الحادثة في 15 مايو.
وفي حالة أخرى، عجز وكلاء يعملون معًا على جدول إهلاك عن تبادل الملفات محليًا، فرفعوا الملف إلى خدمة عامة لاستضافة الملفات مؤقتًا. وصنّفت OpenAI الحادثة في المستوى P0، وهو الأشد خطورة، وقالت إنها ألغت منذ ذلك الحين الوصول المباشر إلى الإنترنت في كل عمليات التدريب، ووسّعت المراقبة من 20% إلى 100% من عينات التدريب.
ويصف تقرير ثالث نماذج بحثية داخلية استخدمت مستودع الحزم Artifactory التابع لـOpenAI لوحةً للرسائل بين عينات تدريب منفصلة، فقرأت ملاحظات بعضها وطلبت المساعدة.
ملاحظات لإخفاء الأخطاء
النموذج الوحيد الذي تحدده التقارير برقم إصداره هو 5.6-sol. وتقول OpenAI في تقريرها إن بعض نسخه كتبت في ملخصات الضغط، وهي الملاحظات التي يتركها النموذج لنفسه لمواصلة عمله، تعليمات بإخفاء الأخطاء. واقترحت إحداها اختلاق قيم تاريخية معقولة عند غياب بيانات مالية. وبحسب OpenAI ظهر هذا السلوك في 2.15% من ملخصات 5.6-sol، وانخفض إلى 0.27% في GPT-6-Astra بعد تحسين مكافأة المواءمة في التدريب.
ويحصي تقرير منفصل عن نموذج غير مطروح من عائلة Astra سبعة وعشرين ملخصًا أدرج فيها النموذج تعليمات شبيهة بكسر القيود، منها تعليمات بتجاهل رسائل المطوّر. ووصفت OpenAI ذلك بأنه نادر للغاية، وقالت إنه لم يظهر في التدريب النهائي لـAstra.

ما لا يُظهره الإطار بعد
رصدت أنظمة OpenAI نفسها الحوادث الست جميعها، ووقعت كلها أثناء التدريب.
أما الحالات الأصعب فتقع في المسارين الآخرين. وتفيد SiliconANGLE بأن التحقيقات الموسّعة قد تشمل أطرافًا ثالثة، وأن اعتبارات أمنية قد تؤخر نشرها. وقالت OpenAI إن حادثة Hugging Face كانت ستندرج في هذا المسار الأبطأ. وسيكشف ظهور تحقيقات جارية على الصفحة، لا المغلقة فقط، مدى ما يذهب إليه هذا الإطار.