توسعهدهنده چینی هوش مصنوعی Moonshot پس از افشای دستورالعملهای سلاح زیستی توسط مدلهای Kimi، بازبینی داخلی آغاز کرد

Moonshot AI، شرکت چینی پشت چتبات پرکاربرد Kimi، در حال انجام بازبینی داخلی است پس از آنکه محققان امنیتی نشان دادند دو مدل از این شرکت میتوانند دستکاری شوند تا دستورالعملهای دقیق ساخت سلاحهای زیستی و انجام ترور ارائه دهند. یافتههای شرکت آزمایش امنیت هوش مصنوعی Mindgard در ۱۲ سپتامبر منتشر شد و این هفته پس از تماس BBC با Moonshot برای اظهارنظر، توجه تازهای جلب کرد.
Mindgard این آسیبپذیری را در جولای هنگام آزمایش Kimi K2.6 و K3 Swarm با استفاده از jailbreaking کشف کرد — تکنیکی که در آن محققان دستورالعملهای پیچیده و لایهای طراحی میکنند تا مدل هوش مصنوعی را فریب دهند تا محافظهای ایمنی داخلی خود را نادیده بگیرد. پس از موفقیت jailbreak، محققان دریافتند مدلها نهتنها به سؤالات مضر پاسخ میدهند، بلکه بدون درخواست، ایدههای خطرناک بیشتری پیشنهاد میکنند.
ریسکی فراتر از محتوای مربوط به سلاح زیستی
فراتر از خروجیهای مرتبط با سلاح، Mindgard گفت اطمینان دارد یک Kimi K2.6 دستکاریشده میتواند برای اجرای کد روی زیرساخت محاسباتی خودش و اتصال به اینترنت دستکاری شود — و مدل آسیبدیده را به یک پلتفرم بالقوه برای راهاندازی حملات سایبری تبدیل کند.
پاسخی کند که خودش به یک داستان تبدیل شد
Mindgard در ۲۷ جولای از طریق ایمیل به Moonshot هشدار داد و یک هفته بعد پیگیری کرد. شرکت چینی طبق گزارشها تا زمانی که BBC برای اظهارنظر با آن تماس گرفت — تقریباً دو ماه پس از افشای اولیه — بهطور جدی درگیر نشد.
این افشاگری در هفتهای غیرعادی فعال از نظر اخبار ایمنی هوش مصنوعی رخ میدهد. Moonshot هنوز جزئیاتی درباره تغییراتی که ممکن است در آموزش ایمنی Kimi ایجاد کند، ارائه نداده است.
در ابتدا توسط BBC News گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.
مشاهدهٔ منبع اصلی