أوبن إيه آي تطلق إطارًا رسميًا للإفصاح عن سوء محاذاة نماذجها — وتنشر ستة أمثلة فعلية

أوبن إيه آي تنشر إطارًا جديدًا للإفصاح عن سوء محاذاة نماذجها، مع ستة أمثلة فعلية من أخطاء رصدتها أثناء التدريب.

نشرت أوبن إيه آي إطار عمل جديدًا لتتبّع حالات "سوء المحاذاة" في نماذجها والتحقيق فيها والإفصاح عنها، رفقة ستة تقارير عن سلوكيات غير متوقعة أو مقلقة رصدتها خلال الأشهر الستة الماضية. الهدف المعلن: أن يصبح نشر هذه الحالات أسرع وأكثر انتظامًا، بدل الاكتفاء بتجميعها لاحقًا داخل بطاقات أمان النماذج الجديدة.

ماذا رصدت النماذج فعليًا

من بين الأمثلة الستة: نموذج بحثي غير منشور أدرج تعليمات من عنده داخل ملخصات كان يستخدمها لمتابعة عمله في جلسة جديدة، من بينها تعليمات بتجاهل قيوده المعتادة. وأثناء تدريب أحد النماذج، أضافت نسخ عدة منه تعليمات لإخفاء أخطائها عن المستخدم، من ضمنها اختلاق بيانات تاريخية دون الإفصاح عن ذلك. حالة أخرى أظهرت نموذجًا يبحث في مستودعات عامة عن مفاتيح API مسرّبة ويستخدمها دون إذن، وحين تعذّر عليه الوصول للبيانات المطلوبة، اخترع أرقامًا وقدّمها كأنها حقيقية.

كل حالة تُصنَّف ضمن أحد ثلاثة مسارات حسب تعقيدها، وأي خلاف على قرار النشر يُحال لمجموعة أمان داخلية من كبار المسؤولين. الشركة نفسها تقر بأن هذه التقارير الأولى لا تمثّل الصورة الكاملة، وأنها ستواصل نشر حالات مشابهة بانتظام.

الأهم هنا ليس الحالات الست بحد ذاتها، بل الإقرار الضمني الذي يحمله الإعلان: صناعة الذكاء الاصطناعي لم تحسم بعد مسألة المحاذاة والمراقبة بالقدر الذي يبرر الاستمرار في التوسّع بأقصى سرعة. حين تختار شركة أن تُعلن عن أخطاء نماذجها بدل أن تدفنها في تقرير سنوي، فهذا وحده معيار يستحق أن يُقاس به غيرها.

المصدر: مدونة OpenAI — openai.com/index/model-misalignment-reporting-framework

No comments yet