میسترال مدل تریلیون‌پارامتری Large 4 را با آموزش روی تنها ۴۰۰۰ پردازنده گرافیکی معرفی کرد

TechCrunch
اشتراک‌گذاری:
میسترال مدل تریلیون‌پارامتری Large 4 را با آموزش روی تنها ۴۰۰۰ پردازنده گرافیکی معرفی کرد

میسترال روز سه‌شنبه از Large 4 رونمایی کرد؛ مدلی چندوجهی با یک تریلیون پارامتر که این آزمایشگاه هوش مصنوعی مستقر در پاریس می‌گوید با حدود ۴۰۰۰ پردازنده گرافیکی Nvidia آموزش داده شده است — بخش بسیار کوچکی از منابع محاسباتی که تصور می‌شود آزمایشگاه‌های رقیب برای آموزش مدل‌های پیشرفته صرف می‌کنند. این مدل که در داخل شرکت «له‌چونک» نام گرفته، هم‌اکنون از طریق یک نقطه دسترسی عمومی با محافظ ایمنی در دسترس است و انتشار وزن‌های متن‌باز آن تا حدود سه هفته دیگر، پس از تکمیل آزمون‌های ایمنی، برنامه‌ریزی شده است.

این عرضه در میانه شکافی سه‌قطبی رو به رشد در صنعت هوش مصنوعی رخ می‌دهد: سیستم‌های بسته و اختصاصی آزمایشگاه‌های آمریکایی، مدل‌های متن‌باز توسعه‌دهندگان چینی مانند دیپ‌سیک و کوئن از علی‌بابا، و گروه رو به کاهش جایگزین‌های متن‌باز غربی. میسترال از زمان تأسیس خود در سال ۲۰۲۳ خود را دقیقاً در این مسیر سوم قرار داده و Large 4 صریح‌ترین تلاش این شرکت تا امروز برای اثبات این ادعاست که مدل‌های متن‌باز توسعه‌یافته در اروپا می‌توانند با هر دو جبهه رقابت کنند، نه اینکه فقط دنباله‌رو آن‌ها باشند.

پیر استوک، معاون علمی میسترال، گفت فرآیند آموزش این مدل «دو تا سه برابر کمتر» از منابع محاسباتی مورد نیاز رقبای چینی به گفته این شرکت، و «به‌طور قابل‌توجهی کمتر» از رقبای متن‌بسته استفاده کرده است. میسترال، Large 4 را به‌طور خاص برای بارهای کاری امنیت سایبری، مالی و طراحی تراشه تنظیم کرده — حوزه‌هایی سازمانی که این شرکت در آن‌ها به‌دنبال جذب مشتریان پرداخت‌کننده است، نه رقابت در آزمون‌های عمومی چت‌بات. این شرکت می‌گوید پس از انتشار وزن‌های متن‌باز، برای استفاده مسئولانه از آن با «شرکای مورد اعتماد و دولت‌ها» همکاری خواهد کرد؛ گفته‌ای که هدف آن کاهش نگرانی‌ها درباره احتمال سوءاستفاده از یک مدل تریلیون‌پارامتری بدون محدودیت برای عملیات سایبری تهاجمی یا طراحی تسلیحات است.

نتایج مستقل آزمون‌های کارایی هنوز منتشر نشده‌اند، بنابراین ادعای میسترال درباره قرار گرفتن در «بهترین رده میان مدل‌های متن‌باز» هنوز خارج از آزمون‌های داخلی خود شرکت تأیید نشده است. اما اگر ارقام مربوط به کارایی مصرف منابع تحت بررسی دقیق‌تر هم درست از آب دربیایند، Large 4 این استدلال را تقویت می‌کند که مدل‌های پیشرفته دیگر به خوشه‌های عظیم پردازنده گرافیکی که اوپن‌ای‌آی، آنتروپیک و گوگل اعتبار خود را بر پایه آن بنا کرده‌اند نیاز ندارند — ادعایی با پیامدهای واقعی برای میزان ظرفیت محاسباتی که باقی صنعت تصور می‌کند باید خریداری کند.

به گزارش اولیه تک‌کرانچ، میسترال پیش از انتشار وزن‌های متن‌باز، قیمت‌گذاری نقطه دسترسی محافظت‌شده را اعلام نکرده است.

در ابتدا توسط TechCrunch گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.

مشاهدهٔ منبع اصلی
اشتراک‌گذاری: