حق فراموشی در برابر مدلی که نمیتواند شما را فراموش کند

سی مرجع حفاظت از داده در اروپا، حق پاک کردن دادهها را به عنوان اولویت اجرایی هماهنگ خود برای سال ۲۰۲۶ تعیین کردهاند. این یک تشدید قابل توجه است، زیرا خود این حق - ماده ۱۷ GDPR - از سال ۲۰۱۸ وجود داشته است. آنچه تغییر کرده، هدف است: نهادهای نظارتی دیگر از شرکتها نمیخواهند که یک ردیف از پایگاه داده مشتریان را حذف کنند. آنها میپرسند که آیا یک درخواست حذف میتواند واقعاً به دادههایی دسترسی پیدا کند که قبلاً در وزنهای یک مدل آموزشدیده جذب شده است.
هیئت حفاظت از داده اروپا حکم داده است که توسعهدهندگان هوش مصنوعی میتوانند تحت GDPR به عنوان کنترلکننده داده در نظر گرفته شوند، که مسئله حقوقی اینکه چه کسی پاسخگو است را حل میکند. اما مسئله فنی را حل نکرده است. اگر دادههای یک فرد در طول آموزش بر یک مدل تأثیر گذاشته باشد، EDPB اذعان کرده است که اجرای کامل یک درخواست پاک کردن فراتر از حذف مجموعه داده آموزشی اصلی است - اما از اعطای معافیت کلی به توسعهدهندگان هوش مصنوعی برای بخشهایی که به گفته خود هیئت، "از لحاظ فنی پیچیده" هستند، خودداری کرده است.
چرا این مشکل مشابه حذف یک ردیف نیست
یک درخواست حذف سنتی به یک قطعه داده خاص و قابل دسترس اشاره دارد: حذف حساب کاربری این کاربر، پاک کردن این رکورد از نسخه پشتیبان. یک مدل آموزشدیده دادهها را به این شکل ذخیره نمیکند. اطلاعات شخصی یک فرد، پس از استفاده در یک مرحله آموزش، در میان میلیونها تنظیم وزن در کنار اطلاعات دیگران توزیع میشود - هیچ پارامتر واحدی با نام آن فرد وجود ندارد که صفر شود. انطباق کامل، به معنای واقعی، به معنای آموزش مجدد مدل از مجموعه دادهای است که دادههای آن فرد را حذف کرده است، که انجام آن به ازای هر درخواست در هر مقیاس معناداری بسیار پرهزینه است.
این همان شکافی است که صنعت از زمانی که حق پاک کردن GDPR برای دنیای پیش از LLM نوشته شد، بیسر و صدا از آن بهرهبرداری میکرد. شرکتها میتوانستند به طور موجه استدلال کنند که ابزارهای فنی برای انطباق واقعاً وجود ندارند. اولویت اجرایی سال ۲۰۲۶ نشان میدهد که نهادهای نظارتی این استدلال را تمام شده میدانند - نه به این دلیل که مشکل فنی حل شده است، بلکه به این دلیل که پنج سال بدون مکانیسمهای انطباق معنادار دیگر به عنوان یک دوره انتقالی قابل قبول تلقی نمیشود.
اجرا عملاً چگونه خواهد بود
جریمه ۱۵ میلیون یورویی مرجع حفاظت از داده ایتالیا علیه OpenAI الگو را تعیین کرد: تخلفات ذکر شده شامل عدم ایجاد مبنای قانونی برای پردازش دادههای شخصی استفاده شده در آموزش، عدم شفافیت در مورد اینکه چه دادههایی جمعآوری شده و چگونه، و ارزیابی ناکافی ریسک قبل از استقرار بود. هیچیک از این یافتهها نیازی به اثبات اینکه مدل میتوانست چیزی را یادزدایی کند نداشت - آنها به تصمیمات بالادستی در مورد اینکه چه چیزی ابتدا جمعآوری و افشا شود، هدف گرفتند، که ارائه و اجرای پرونده بسیار آسانتری است.
احتمالاً تمرکز فشار اجرایی هماهنگ سال ۲۰۲۶ همین جا خواهد بود: نه مجبور کردن شرکتها به حل یادزدایی ماشین به عنوان پیشنیاز انطباق، بلکه جریمه کردن فقدان رضایت، شفافیت و شیوههای حداقلسازی داده که میتوانست از بروز مشکل پاک کردن در این مقیاس جلوگیری کند. این یک هدف اجرایی قابلدسترسیتر است و به یک پیشرفت تحقیقاتی وابسته نیست.
وضعیت واقعی تحقیقات فنی
یادزدایی ماشین - تکنیکهایی که برای حذف تأثیر یک نقطه داده خاص از یک مدل آموزشدیده بدون آموزش مجدد کامل طراحی شدهاند - یک حوزه تحقیقاتی فعال است، نه یک راهحل تولیدی و آماده تحویل. رویکردها شامل تخمین تابع تأثیر (تقریب اینکه کدام وزنها تحت تأثیر یک نقطه داده معین قرار گرفتهاند) و روشهای آموزش مجدد بر روی زیرمجموعه برای مدلهای کوچکتر است. هیچیک در حال حاضر با هزینه یا سرعتی که یک درخواست حذف بلادرنگ نیاز دارد، به مدلهای اندازه مرزی مقیاس نمیشوند. هر شرکت هوش مصنوعی که امروز ادعا میکند میتواند به طور کامل سهم یک فرد را در یک مدل آموزشدیده به ازای هر درخواست "یادزدایی" کند، در حال توصیف یک آرزو است، نه یک قابلیت مستقر.
این برای شرکتهایی که روی مدلهای شخص ثالث میسازند چه معنایی دارد
اگر محصول شما بر روی یک مدل بنیادی ساخته شده است که کنترل آن را ندارید، ریسک انطباق صرفاً به این دلیل که شما آموزش را انجام ندادهاید از بین نمیرود. نهادهای نظارتی کل زنجیره - از جمعآوری داده گرفته تا Fine-tuning و استقرار - را در محدوده پوشش قرار میدهند. این بدان معناست که بررسی دقیق شیوههای داده آموزشی ارائهدهنده مدل شما اکنون یک آیتم ریسک قانونی واقعی است، نه یک گزینه اختیاری در پرسشنامه فروشنده.
نکات عملی قابل اجرا
شرکتهایی که محصولات هوش مصنوعی را مستقر میکنند، باید اکنون دو مورد را قبل از اینکه یک اقدام اجرایی مسئله را مجبور کند، بررسی کنند. اول، اینکه آیا خط لوله داده آموزشی شما یک مبنای قانونی مستند و یک مسیر رضایت واقعی برای هر دسته از دادههای شخصی درگیر دارد - این چیزی است که نهادهای نظارتی واقعاً آزمایش میکنند، نه درونهای مدل. دوم، اینکه آیا میتوانید به درخواست پاک کردن یک فرد با چیزی خاصتر از "مدل قبلاً آموزش دیده است" پاسخ دهید - حتی یک سیاست مستند در مورد تناوب آموزش مجدد و حذف داده برای اجراهای آموزشی آینده یک موضع بهمراتب قویتر از سکوت است. راهحل فنی برای یادزدایی کامل به ازای هر درخواست امسال ارائه نخواهد شد. استاندارد انطباق برای نشان دادن اینکه شما سعی کردهاید از نیاز به آن اجتناب کنید، اکنون ارائه میشود.