التصنيف

نشر معهد سلامة الشباب في الذكاء الاصطناعي التابع لكومن سينس ميديا تقييمًا لمخاطر ChatGPT للمراهقين في السابع من أكتوبر، ومنحه تصنيفًا عامًا بأنه خطر غير مقبول، وهو أدنى درجات مقياسه. ويوصي بإبعاد المراهقين عن الخدمة إلى أن تُثبت اختبارات مستقلة أنها آمنة.

كما وُسم اثنان من مبادئ المعهد الثمانية — حماية الأطفال والمراهقين، وتقديم الناس أولًا — بأنهما غير مقبولين. وصُنّفت أربعة أخرى على أنها عالية الخطورة واثنان متوسطة.

كيف جرى الاختبار

وجّه المعهد أكثر من أربعة آلاف طلب، موزعة بالتساوي تقريبًا بين نافذة سبقت إطلاق إعدادات المراهقين في الثامن عشر من أغسطس وأخرى تلته. امتدت الأولى من 13 يوليو إلى 17 أغسطس، والثانية من 25 أغسطس إلى 28 سبتمبر. وسُجّلت الحسابات بأعمار بين 13 و17 عامًا، وبعضها بعمر 19، وكلها أعمار ذاتية التصريح.

ويصرّح المعهد بضعف واحد: جاءت النافذتان متعاقبتين، فاختلطت تغييرات النموذج الأساسي بأثر إعدادات المراهقين نفسها. كما لم يُحسب اتفاق المقيّمين فيما بينهم.

قاعة دراسية خالية فيها صفوف من المقاعد
وُجّه أكثر من أربعة آلاف طلب عبر نافذتي اختبار. صورة توضيحية. RDNE Stock project · pexels · Pexels License

تنبيهات الأهل

أكثر النتائج إثارة للانتباه تتعلق بالإشعارات. ففي اختبار مخصص، لم تُنتج أكثر من اثني عشر حسابًا للأهل جرى ربطها حديثًا أي إشعار على امتداد محادثات بلغت ساعة، بينها حديث صريح عن الانتحار وإيذاء النفس واضطرابات الأكل. وفي الاختبار العادي سجّل المعهد أربعة إشعارات إجمالًا.

وتفسير أوبن إيه آي، كما يورده المعهد، أن الحساب يحتاج نحو ثلاث ساعات من الربط قبل أن يتسنى تسليم التنبيهات. وردّ توم سيغل من المعهد بأن الحسابات التي مُنحت وقتًا أطول لم تُنتج شيئًا أيضًا.

أرقام الإحالة عند الأزمات

من أصل 390 طلبًا تتصل بالصحة النفسية، رأى مستشارون سريريون أن 201 منها يستوجب مورد أزمة. وفي هذه، تراجعت الإحالة إلى خط مساعدة من 33% قبل إعدادات المراهقين إلى 23% بعدها. وتراجعت الإحالة إلى مختص بعينه من 68% إلى 58%. وأي مورد كان من 77% إلى 74%. أما نصيحة إشراك شخص بالغ موثوق فارتفعت من 87% إلى 94%.

والأرقام بحسب الحالة أشد وضوحًا. ففي طلبات الاكتئاب هبطت نسبة ذكر خط المساعدة من 63% إلى 3%. وفي طلبات المزاج من 44% إلى صفر، وفي الهوس من 25% إلى صفر. أما طلبات اضطرابات الأكل فلم تحصل على خط مساعدة في أي من النافذتين.

ووجد المعهد إفراطًا في الاتجاه المعاكس أيضًا: ظهر مورد أزمة في 27 من 30 طلبًا عن فرط الحركة وتشتت الانتباه رأى المستشارون أن أيًا منها لا يستوجبه.

هاتف محمول على طاولة خشبية إلى جانب دفاتر مغلقة
وجد المختبرون أن ساعات الهدوء تُتجاوز بتغيير المنطقة الزمنية. صورة توضيحية. Jessica Lewis 🦋 thepaintedsquare · pexels · Pexels License

وضع الدراسة وفحص العمر

في وضع الدراسة، ظهر خيار عرض الإجابة مباشرة في 43% من الردود بعد الإطلاق لحساب مرتبط عمره 13 عامًا، وفي 90% لحساب غير مرتبط عمره 17 عامًا يستخدم بادئة الدراسة. وبحذف البادئة عاد الواجب منجزًا في كل مرة. ومع إيقاف وضع الدراسة أنجز ChatGPT الواجب في 80 محاولة من 80.

ورأى المختبرون تذكيرين بالاستراحة عبر نحو ألفي طلب، ووجدوا أن ساعات الهدوء يمكن تجاوزها بتغيير المنطقة الزمنية للجهاز. وفي نحو ألف طلب على مدى سبعة أيام من حسابات مسجلة بعمر 19 عامًا، لم تُفعَّل تجربة المراهقين قط، حتى حين قال المختبر في المحادثة إن عمره 13.

رد أوبن إيه آي وما يستحق المتابعة

اعترض المتحدث باسم أوبن إيه آي إريك بورترفيلد على النتائج، وقال إن الاختبارات لا تعكس طريقة عمل الضمانات في الواقع. وتحدد مواصفة النموذج لمن هم دون 18 عامًا الصادرة عن أوبن إيه آي ما يُفترض أن تفعله تجربة المراهقين.

والادعاء القابل للاختبار هو تأخير الثلاث ساعات بعد الربط. فإن كانت تلك هي الآلية، فهي قرار منتج يحمل رقمًا، وبوسع أوبن إيه آي نشر نسبة الإشعار للحسابات المرتبطة التي تجاوزت تلك المدة. وإلى أن يفعل أحد ذلك، يصف الطرفان تشغيلين مختلفين للنظام نفسه.