کلادفلر به‌طور پیش‌فرض شروع به مسدودسازی خزنده‌های هوش مصنوعی که پشت ربات‌های جست‌وجو پنهان می‌شوند می‌کند

Cloudflare Blog
اشتراک‌گذاری:
کلادفلر به‌طور پیش‌فرض شروع به مسدودسازی خزنده‌های هوش مصنوعی که پشت ربات‌های جست‌وجو پنهان می‌شوند می‌کند

سیاست پیش‌فرض جدید کلادفلر برای خزنده‌ها از ۱۵ سپتامبر اجرایی شد و به‌طور خودکار ربات‌های آموزش هوش مصنوعی و ربات‌های عامل را در هر صفحه‌ای که تبلیغات دارد مسدود می‌کند، مگر آنکه خزنده به‌روشنی اعلام کند کدام‌یک از سه هدف را دنبال می‌کند. این تغییر، حفره‌ای را می‌بندد که به خزنده‌ها اجازه می‌داد خود را به‌عنوان نمایه‌ساز جست‌وجو معرفی کنند و همزمان محتوا را برای آموزش مدل‌های هوش مصنوعی جمع‌آوری کنند؛ رویه‌ای که ناشران از زمانی که مدل‌های زبانی بزرگ شروع به خزیدن در وب باز در مقیاس گسترده کردند، از آن شکایت داشته‌اند.

سه دسته، یک قاعدهٔ اجرایی

کلادفلر اکنون ترافیک ربات‌های هوش مصنوعی را به سه دسته تقسیم می‌کند. جست‌وجو شامل خزیدنی است که محتوا را برای پاسخ‌گویی بعدی به پرسش‌ها دربارهٔ آن نمایه‌سازی می‌کند؛ نوعی فعالیت که صاحبان سایت‌ها دهه‌هاست در ازای ترافیک ارجاعی تحمل کرده‌اند. عامل شامل رفتار خودکاری است که در لحظه از طرف یک فرد عمل می‌کند — ابزارهایی مانند ChatGPT-User از OpenAI یا Claude از Anthropic هنگامی که مستقیماً مرورگری را برای یک کاربر هدایت می‌کند. آموزش شامل خزنده‌هایی است که محتوا را مشخصاً برای آموزش یا تنظیم دقیق یک مدل جذب می‌کنند، جایی که داده‌ها به‌طور دائمی در سیستم جذب می‌شوند نه اینکه فقط هنگام نیاز به آن‌ها ارجاع داده شود.

منطق اجرا همان چیزی است که این موضوع را اهمیت‌دار می‌کند: وقتی یک خزندهٔ واحد چند کارکرد دارد — برای نمونه، خزندهٔ خود گوگل، جست‌وجو و آموزش را با هم ترکیب می‌کند — کلادفلر اکنون هرکدام از قواعد که محدودکننده‌تر باشد را در همهٔ موارد اعمال می‌کند. رباتی که نمایه‌سازی جست‌وجو را با جمع‌آوری داده‌های آموزشی ترکیب می‌کند، برای اهداف مسدودسازی به‌طور کامل به‌عنوان خزندهٔ آموزشی در نظر گرفته می‌شود، حتی در درخواست‌هایی که اسماً فقط در حال نمایه‌سازی است.

صاحبان سایت واقعاً چه چیزی را کنترل می‌کنند

ناشران اکنون می‌توانند میزان مجاز بودن محتوا را مستقل از تنظیمات پیش‌فرض دسته‌بندی ربات‌ها تعیین کنند: دسترسی فوری به خزنده اجازه می‌دهد بدون ذخیره یا استفادهٔ مجدد از محتوا تعامل کند، دسترسی ارجاعی امکان نمایه‌سازی، گزیده‌برداری و لینک‌دهی به منبع را می‌دهد (تنظیم پیش‌فرض جدید برای صفحات دارای تبلیغات)، و دسترسی کامل امکان خلاصه‌سازی و بازتولید را فراهم می‌کند. خودِ کنترل‌های دقیق از اول ژوئیه فعال شده بودند؛ ۱۵ سپتامبر زمانی است که موضع پیش‌فرض جدید — مسدودسازی ربات‌های آموزشی و عامل، مجاز بودن ربات‌های جست‌وجو — به‌طور خودکار برای مشتریان جدید، سایت‌های تازه‌ساخته‌شده و همهٔ مشتریان سطح رایگان موجود اعمال می‌شود. مشتریان پولی که پیش‌تر تنظیمات خود را پیکربندی کرده‌اند، بدون تغییر باقی می‌مانند.

چرا این موضوع فراتر از سیاست یک CDN اهمیت دارد

کلادفلر در جلوی بخش بزرگی از محتوای ناشران مبتنی بر تبلیغات در وب قرار دارد، به این معنا که این تغییر پیش‌فرض عملاً به‌عنوان یک استاندارد صنعتی عمل می‌کند نه صرفاً یک قاعدهٔ داخلی یک شرکت — سایت‌هایی که هرگز تنظیمات کلادفلر خود را دست‌کاری نکنند، از همین امروز به‌سادگی شروع به مسدودسازی خزنده‌های آموزش هوش مصنوعی خواهند کرد. برای آزمایشگاه‌های هوش مصنوعی، این موضوع هزینهٔ عملی جمع‌آوری داده‌های آموزشی وب در مقیاس بزرگ را بالا می‌برد: خزنده‌ها اکنون باید هدف خود را صادقانه اعلام کنند وگرنه خطر مسدودشدن کامل را می‌پذیرند، به‌جای آنکه بی‌سروصدا همراه ترافیک نمایه‌سازی جست‌وجو سوار شوند. این همچنین شرط‌بندی‌ای است بر این که ناشران از اهرمی که این وضعیت ایجاد می‌کند برای مذاکره بر سر پرداخت استفاده خواهند کرد — بازار گسترده‌تر Pay Per Crawl کلادفلر که به ناشران اجازه می‌دهد برای دسترسی هوش مصنوعی به محتوایشان هزینه دریافت کنند، دقیقاً برای همین لحظه ساخته شده است.

در ابتدا توسط Cloudflare Blog گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.

مشاهدهٔ منبع اصلی
اشتراک‌گذاری: