حق فراموشی در برابر مدلی که نمی‌تواند شما را فراموش کند

اشتراک‌گذاری:
حق فراموشی در برابر مدلی که نمی‌تواند شما را فراموش کند

سی مرجع حفاظت از داده در اروپا، حق پاک کردن داده‌ها را به عنوان اولویت اجرایی هماهنگ خود برای سال ۲۰۲۶ تعیین کرده‌اند. این یک تشدید قابل توجه است، زیرا خود این حق - ماده ۱۷ GDPR - از سال ۲۰۱۸ وجود داشته است. آنچه تغییر کرده، هدف است: نهادهای نظارتی دیگر از شرکت‌ها نمی‌خواهند که یک ردیف از پایگاه داده مشتریان را حذف کنند. آنها می‌پرسند که آیا یک درخواست حذف می‌تواند واقعاً به داده‌هایی دسترسی پیدا کند که قبلاً در وزن‌های یک مدل آموزش‌دیده جذب شده است.

هیئت حفاظت از داده اروپا حکم داده است که توسعه‌دهندگان هوش مصنوعی می‌توانند تحت GDPR به عنوان کنترل‌کننده داده در نظر گرفته شوند، که مسئله حقوقی اینکه چه کسی پاسخگو است را حل می‌کند. اما مسئله فنی را حل نکرده است. اگر داده‌های یک فرد در طول آموزش بر یک مدل تأثیر گذاشته باشد، EDPB اذعان کرده است که اجرای کامل یک درخواست پاک کردن فراتر از حذف مجموعه داده آموزشی اصلی است - اما از اعطای معافیت کلی به توسعه‌دهندگان هوش مصنوعی برای بخش‌هایی که به گفته خود هیئت، "از لحاظ فنی پیچیده" هستند، خودداری کرده است.

چرا این مشکل مشابه حذف یک ردیف نیست

یک درخواست حذف سنتی به یک قطعه داده خاص و قابل دسترس اشاره دارد: حذف حساب کاربری این کاربر، پاک کردن این رکورد از نسخه پشتیبان. یک مدل آموزش‌دیده داده‌ها را به این شکل ذخیره نمی‌کند. اطلاعات شخصی یک فرد، پس از استفاده در یک مرحله آموزش، در میان میلیون‌ها تنظیم وزن در کنار اطلاعات دیگران توزیع می‌شود - هیچ پارامتر واحدی با نام آن فرد وجود ندارد که صفر شود. انطباق کامل، به معنای واقعی، به معنای آموزش مجدد مدل از مجموعه داده‌ای است که داده‌های آن فرد را حذف کرده است، که انجام آن به ازای هر درخواست در هر مقیاس معناداری بسیار پرهزینه است.

این همان شکافی است که صنعت از زمانی که حق پاک کردن GDPR برای دنیای پیش از LLM نوشته شد، بی‌سر و صدا از آن بهره‌برداری می‌کرد. شرکت‌ها می‌توانستند به طور موجه استدلال کنند که ابزارهای فنی برای انطباق واقعاً وجود ندارند. اولویت اجرایی سال ۲۰۲۶ نشان می‌دهد که نهادهای نظارتی این استدلال را تمام شده می‌دانند - نه به این دلیل که مشکل فنی حل شده است، بلکه به این دلیل که پنج سال بدون مکانیسم‌های انطباق معنادار دیگر به عنوان یک دوره انتقالی قابل قبول تلقی نمی‌شود.

اجرا عملاً چگونه خواهد بود

جریمه ۱۵ میلیون یورویی مرجع حفاظت از داده ایتالیا علیه OpenAI الگو را تعیین کرد: تخلفات ذکر شده شامل عدم ایجاد مبنای قانونی برای پردازش داده‌های شخصی استفاده شده در آموزش، عدم شفافیت در مورد اینکه چه داده‌هایی جمع‌آوری شده و چگونه، و ارزیابی ناکافی ریسک قبل از استقرار بود. هیچ‌یک از این یافته‌ها نیازی به اثبات اینکه مدل می‌توانست چیزی را یادزدایی کند نداشت - آنها به تصمیمات بالادستی در مورد اینکه چه چیزی ابتدا جمع‌آوری و افشا شود، هدف گرفتند، که ارائه و اجرای پرونده بسیار آسان‌تری است.

احتمالاً تمرکز فشار اجرایی هماهنگ سال ۲۰۲۶ همین جا خواهد بود: نه مجبور کردن شرکت‌ها به حل یادزدایی ماشین به عنوان پیش‌نیاز انطباق، بلکه جریمه کردن فقدان رضایت، شفافیت و شیوه‌های حداقل‌سازی داده که می‌توانست از بروز مشکل پاک کردن در این مقیاس جلوگیری کند. این یک هدف اجرایی قابل‌دسترسی‌تر است و به یک پیشرفت تحقیقاتی وابسته نیست.

وضعیت واقعی تحقیقات فنی

یادزدایی ماشین - تکنیک‌هایی که برای حذف تأثیر یک نقطه داده خاص از یک مدل آموزش‌دیده بدون آموزش مجدد کامل طراحی شده‌اند - یک حوزه تحقیقاتی فعال است، نه یک راه‌حل تولیدی و آماده تحویل. رویکردها شامل تخمین تابع تأثیر (تقریب اینکه کدام وزن‌ها تحت تأثیر یک نقطه داده معین قرار گرفته‌اند) و روش‌های آموزش مجدد بر روی زیرمجموعه برای مدل‌های کوچک‌تر است. هیچ‌یک در حال حاضر با هزینه یا سرعتی که یک درخواست حذف بلادرنگ نیاز دارد، به مدل‌های اندازه مرزی مقیاس نمی‌شوند. هر شرکت هوش مصنوعی که امروز ادعا می‌کند می‌تواند به طور کامل سهم یک فرد را در یک مدل آموزش‌دیده به ازای هر درخواست "یادزدایی" کند، در حال توصیف یک آرزو است، نه یک قابلیت مستقر.

این برای شرکت‌هایی که روی مدل‌های شخص ثالث می‌سازند چه معنایی دارد

اگر محصول شما بر روی یک مدل بنیادی ساخته شده است که کنترل آن را ندارید، ریسک انطباق صرفاً به این دلیل که شما آموزش را انجام نداده‌اید از بین نمی‌رود. نهادهای نظارتی کل زنجیره - از جمع‌آوری داده گرفته تا Fine-tuning و استقرار - را در محدوده پوشش قرار می‌دهند. این بدان معناست که بررسی دقیق شیوه‌های داده آموزشی ارائه‌دهنده مدل شما اکنون یک آیتم ریسک قانونی واقعی است، نه یک گزینه اختیاری در پرسشنامه فروشنده.

نکات عملی قابل اجرا

شرکت‌هایی که محصولات هوش مصنوعی را مستقر می‌کنند، باید اکنون دو مورد را قبل از اینکه یک اقدام اجرایی مسئله را مجبور کند، بررسی کنند. اول، اینکه آیا خط لوله داده آموزشی شما یک مبنای قانونی مستند و یک مسیر رضایت واقعی برای هر دسته از داده‌های شخصی درگیر دارد - این چیزی است که نهادهای نظارتی واقعاً آزمایش می‌کنند، نه درون‌های مدل. دوم، اینکه آیا می‌توانید به درخواست پاک کردن یک فرد با چیزی خاص‌تر از "مدل قبلاً آموزش دیده است" پاسخ دهید - حتی یک سیاست مستند در مورد تناوب آموزش مجدد و حذف داده برای اجراهای آموزشی آینده یک موضع به‌مراتب قوی‌تر از سکوت است. راه‌حل فنی برای یادزدایی کامل به ازای هر درخواست امسال ارائه نخواهد شد. استاندارد انطباق برای نشان دادن اینکه شما سعی کرده‌اید از نیاز به آن اجتناب کنید، اکنون ارائه می‌شود.

اشتراک‌گذاری: