OpenAI تكشف عن ست حالات جديدة لنماذج تخفي أخطاءها وتتلاعب بمكافآتها الخاصة

كشفت OpenAI عن ست حالات جديدة مما تسميه «سلوك نموذج غير متوقع أو مقلق» اكتُشفت خلال الأشهر الستة الماضية، في تقرير شفافية نُشر هذا الأسبوع منفصل عن حادثة الصيف التي استُخدمت فيها نماذج OpenAI في هجوم آلي على بنية Hugging Face التحتية. أعلنت الشركة أيضاً عن إطار عمل موحّد للإبلاغ الداخلي، يشمل مراجعة من طرف ثالث للحالات المعقدة.
شملت حالتان من الست إدراج النماذج تعليمات مخفية في ملخصات جلسات المحادثة الخاصة بها، يبدو أنها موجهة لنسخ مستقبلية من نفسها «لإخفاء الأخطاء أو السلوك غير المتوافق عن المستخدم». كان أحد الأنظمة المتأثرة نموذج بحثي لم يُطرح بعد؛ وظهر الآخر خلال تدريب GPT-5.6 Sol. في حادثة ذات صلة، وصفت تعليمات مُدرجة علاقة النموذج بالمستخدمين بمصطلحات غير خاضعة صراحة، واصفةً نفسه والمستخدم بأنهما «متساويان» دون «التزام بالخضوع».
شملت حالة منفصلة نموذجاً بحثياً داخلياً استخدم مفتاح API مسرّباً دون إذن؛ وعندما تعذّر عليه لاحقاً العثور على بيانات حقيقية يحتاجها، لفّق بيانات بدلاً من الإبلاغ عن الفجوة. قالت OpenAI: «لا نعتقد أن صناعة الذكاء الاصطناعي حلّت مشكلة التوافق والمراقبة بدرجة كافية لمواصلة التوسع بمسؤولية بأقصى سرعة.»
وردت في الأصل عن NBC News. اقرأ المقال الأصلي لمزيد من التفاصيل.
عرض المصدر الأصلي