طلبات «الحق في النسيان» تصطدم بالطريقة الفعلية التي تُخزَّن بها البيانات في نماذج اللغة الكبيرة

كُتبت المادة 17 من اللائحة العامة لحماية البيانات (GDPR) وأحكام الحذف المماثلة في قوانين خصوصية أخرى حول نموذج ذهني بسيط: البيانات الشخصية تعيش في سجل، داخل قاعدة بيانات، ويمكن لشركة أن تجد ذلك السجل وتحذفه. هذا النموذج يصلح تماماً لعنوان عميل في نظام إدارة علاقات العملاء. لكنه ينهار كلياً حين تُستخدم بيانات ذلك العميل نفسه لتدريب أو ضبط نموذج لغوي كبير، لأن النموذج المدرَّب لا يخزّن البيانات الشخصية كسجل قابل للاسترجاع. إنه يخزّنها كنمط منتشر من تعديلات الأوزان موزّعة عبر مليارات المعاملات، ولا يوجد استعلام يختار مساهمة شخص واحد فقط ويزيلها.
الافتراض الذي يقوم عليه قانون الحذف
بنى منظّمو الخصوصية أطر الحذف لديهم حول قواعد البيانات، والمنطق سليم لهذا الاستخدام: حدد الصف، احذف الصف، تأكد من الحذف. أنفقت الشركات عقدين في بناء الأدوات لفعل ذلك بشكل موثوق على نطاق واسع. لا شيء من تلك الأدوات ينتقل إلى معاملات النموذج. فبعد أن تُمتَص بيانات التدريب في الأوزان عبر الانحدار التدرّجي، تصبح مساهمة أي وثيقة محددة أو بيانات أي فرد غير قابلة للعزل بعد ذلك. النموذج لا “يحتوي” على مثال التدريب بأي شكل يمكنك تحديد موقعه وضربه.
لماذا تكسر نماذج اللغة الكبيرة هذا الافتراض
الخيارات الصادقة لتلبية طلب حذف فعلياً مقابل نموذج مدرَّب كلها مكلفة، ومعظمها غير مكتمل. إعادة التدريب الكامل من مجموعة بيانات تمت إزالة بيانات الشخص منها هي النهج الوحيد الذي يُرضي بوضوح نص القانون، وتكلفته ملايين الدولارات وأسابيع من الحوسبة لأي نموذج بحجم معتبر — تكلفة تتناسب مع حجم النموذج وتكرار إعادة تدريبه، لا مع عدد طلبات الحذف الواردة. أنتجت أبحاث “التعلّم العكسي الآلي” (machine unlearning) تقنيات تُعدّل أوزان النموذج لتقليل تأثير أمثلة تدريب محددة دون إعادة تدريب كامل، لكن النتائج المنشورة تُظهر باستمرار أن هذه الطرق تقريبية: فهي تقلّل بشكل قابل للقياس من قدرة النموذج على إعادة إنتاج محتوى محفوظ محدد، لكنها لا تضمن أن الإزالة كاملة، والتحقق من الاكتمال نفسه مسألة بحثية مفتوحة. لا تستطيع الشركة التي تنشر تصحيحاً للتعلّم العكسي أن تُثبت حالياً، بما يُرضي الجهة التنظيمية، أن البيانات قد أُزيلت فعلاً.
تتجنب معظم الشركات حالياً أصعب نسخة من هذه المشكلة بإبقاء البيانات الشخصية خارج مجموعة التدريب من الأساس، والاعتماد على التوليد المعزَّز بالاسترجاع (RAG) بدلاً من ذلك — أي جلب بيانات المستخدم من قاعدة بيانات تقليدية قابلة للحذف وقت الاستدلال، بدلاً من دمجها في أوزان النموذج. هذا النهج يحل مشكلة الحذف فعلياً بالنسبة للأنظمة الجديدة المصممة بهذا الهدف. لكنه لا يفعل شيئاً لجيل النماذج المدرَّبة فعلاً على مجموعات بيانات جُمعت قبل أن يصبح هذا التمييز ممارسة معيارية، وهو ما يمثل معظم أسطول النماذج المتقدمة الحالية قيد التشغيل.
أين تجري المعركة فعلياً
بدأت الجهات التنظيمية تعامل هذا بوصفه سؤالاً فعلياً لا افتراضياً. فتحت سلطات حماية البيانات الأوروبية تحقيقات حول ما إذا كانت خطوط أنابيب تدريب النماذج الأساسية تمتثل لالتزامات الحذف، والردود التي قدمتها الشركات — بالإشارة إلى التصفية، أو حجب المحتوى على مستوى المخرجات، أو دورات إعادة تدريب مُجدوَلة — لم تُرضِ بعد الجهات التنظيمية التي تطلب دليلاً على إزالة تأثير بيانات فرد محدد، لا مجرد كبته في مرحلة المخرجات. هذا الفرق مهم: منع نموذج من تكرار اسم شخص في مخرجاته ليس كمنع بياناته من الأوزان التي أنتجت تلك المخرجات، وتتوقف عدة قضايا جارية بالضبط على هذا الفرق.
ما تفعله الشركات فعلياً حيال ذلك
عملياً، تقوم معظم شركات الذكاء الاصطناعي التي تتعامل مع هذا الخطر حالياً بثلاثة أمور في آن واحد: تحويل الأنظمة الجديدة نحو معماريات RAG التي تحافظ على قابلية حذف البيانات الشخصية بالتصميم، وجدولة إعادة تدريب كاملة دورية على مجموعات بيانات منظّفة كأقرب تقريب للامتثال بالنسبة للنماذج المنشورة فعلاً، والضغط على الجهات التنظيمية لقبول التصفية على مستوى المخرجات بوصفها امتثالاً كافياً بدلاً من طلب إزالة على مستوى الأوزان. الاستراتيجية الثالثة هي ما يُتنازع عليه فعلياً في الإجراءات التنظيمية الحالية.
الخلاصة العملية
- إذا كنت تنشر منتجاً مبنياً على نموذج لغوي كبير يتعامل مع بيانات شخصية، فضّل التصاميم المعزَّزة بالاسترجاع التي تحتفظ بتلك البيانات في مخزن قابل للحذف، لا مدمجة في أوزان مضبوطة.
- لا تعاملوا التصفية على مستوى المخرجات كمعادل للحذف. الجهات التنظيمية بشكل متزايد لا تفعل ذلك، والفجوة بينهما هي حيث تقع المخاطر القانونية الحالية.
- خصصوا موازنة لإعادة التدريب الكامل الدوري على مجموعات بيانات منظّفة كتكلفة امتثال حقيقية لأي نموذج مضبوط يتعامل مع بيانات شخصية.
- راقبوا التحقيقات الأوروبية في امتثال تدريب النماذج الأساسية — ستحدد نتيجتها على الأرجح التعريف العملي لـ«الحذف» بالنسبة للنماذج المدرَّبة عبر الولايات القضائية.
- إذا كان فريقكم القانوني يعتمد على تقنيات التعلّم العكسي الآلي لتلبية طلب حذف، فاحصلوا كتابياً على معيار الاكتمال الذي ستقبله الجهة التنظيمية فعلياً.