PrismML مدل هوش مصنوعی ۲۷ میلیارد پارامتری را در ۳.۹ گیگابایت جای می‌دهد — آنقدر کوچک که در آیفون جا می‌شود

PrismML
اشتراک‌گذاری:
PrismML مدل هوش مصنوعی ۲۷ میلیارد پارامتری را در ۳.۹ گیگابایت جای می‌دهد — آنقدر کوچک که در آیفون جا می‌شود

PrismML مدل Bonsai 27B را منتشر کرده است، مدلی مبتنی بر Qwen3.6 27B که به گفته این شرکت اولین هوش مصنوعی با ۲۷ میلیارد پارامتر است که به راحتی در یک گوشی جا می‌گیرد. این دستاورد از طریق کوانتیزاسیون شدید وزن ممکن شده است: به جای ذخیره هر پارامتر به صورت یک عدد اعشاری ۱۶ بیتی، Bonsai 27B از وزن‌های باینری {−۱, +۱} استفاده می‌کند — فقط یک بیت به ازای هر پارامتر — تا مدلی را که در غیر این صورت ۵۴ گیگابایت حافظه مصرف می‌کرد، به ۳.۹ گیگابایت فشرده کند، اندازه‌ای به قدر کافی کوچک که در محدوده حافظه یک آیفون ۱۷ پرو اجرا شود.


تاکنون، رده ۲۷ میلیارد پارامتری کاملاً در قلمرو لپ‌تاپ یا سرور قرار داشت. حتی کوانتیزاسیون تهاجمی ۴ بیتی یک مدل ۲۷ میلیارد پارامتری حدود ۱۸ گیگابایت حجم دارد — که برای هر گوشی هوشمند فعلی بسیار بزرگ است. روش PrismML فشرده‌سازی را بسیار فراتر می‌برد بدون افت کیفیت فاجعه‌بار، با تکیه بر تکنیک‌هایی که شرکت در انتشارات قبلی ۱ بیتی و سه‌تایی در مقیاس‌های کوچک‌تر نشان داده بود.


دو نسخه، دو کاربرد

Bonsai 27B در دو پیکربندی عرضه می‌شود:

  • Bonsai 27B سه‌تایی (۵.۹ گیگابایت): از وزن‌های سه‌تایی {−۱, ۰, +۱} با ۱.۷۱ بیت مؤثر به ازای هر وزن استفاده می‌کند. این نسخه کیفیت‌محور است و لپ‌تاپ‌های روزمره را هدف قرار می‌دهد و ۹۵٪ از عملکرد مدل کامل را حفظ می‌کند.
  • Bonsai 27B یک بیتی (۳.۹ گیگابایت): از وزن‌های باینری {−۱, +۱} با ۱.۱۲۵ بیت مؤثر به ازای هر وزن استفاده می‌کند. این نسخه گوشی‌ها را هدف قرار می‌دهد و در محدوده حافظه آیفون ۱۷ پرو جا می‌گیرد و ۹۰٪ از عملکرد مدل کامل را حفظ می‌کند.

هر دو نسخه از پشتیبانی چندوجهی (multimodal) برخوردارند، با برج دیداری (vision tower) که به صورت فشرده ۴ بیتی ارائه شده است. آنها یک پنجره زمینه کامل ۲۶۲ هزار توکنی دارند، از رمزگشایی حدسی (speculative decoding) برای استنتاج سریع‌تر پشتیبانی می‌کنند، و فراخوانی‌های ابزار چندمرحله‌ای و حلقه‌های عاملی (agentic loops) را مدیریت می‌کنند — همان نوع بارهای کاری پایدار که مدل‌های روی‌دستگاه در گذشته با مشکل مواجه می‌شدند.


تصویر بنچمارک‌ها

PrismML هر دو نسخه را در ۱۵ آزمون در حالت تفکر (thinking mode) بنچمارک کرد. امتیازات ریاضی و کدنویسی تقریباً تحت تأثیر قرار نگرفته‌اند: مدل سه‌تایی در ریاضی ۹۳.۴ امتیاز در مقابل ۹۵.۳ خط پایه، و مدل یک بیتی ۹۱.۷ را حفظ می‌کند. وظایف فراخوانی ابزار و عاملی (agentic) تأثیر فشرده‌سازی بیشتری نشان می‌دهند — مدل یک بیتی ۶۶.۰ امتیاز در مقابل ۸۰.۰ خط پایه — اما PrismML اشاره می‌کند که اینها همچنان از نسخه‌های ۴ بیتی معمولی همان مدل پایه بهتر عمل می‌کنند در حالی که ۲.۵ برابر حافظه کمتری اشغال می‌کنند.

این شرکت این موضوع را بر حسب «چگالی هوش» (intelligence density) — عملکرد به ازای هر گیگابایت — قاب‌بندی می‌کند، جایی که Bonsai 27B یک بیتی به ۰.۵۳ به ازای هر گیگابایت دست می‌یابد، که تقریباً ۱۰ برابر خط پایه مدل کامل و ۲.۷ برابر بهترین جایگزین کم‌بیت معمولی است.


چرا برای هوش مصنوعی عاملی مهم است

نتیجه عملی این است که وظایفی که نیازمند یک مدل استدلال توانمند هستند — تحلیل اسناد، استخراج داده‌های ساخت‌یافته، تولید کد چندمرحله‌ای — اکنون می‌توانند کاملاً روی دستگاه اجرا شوند، بدون ارسال داده به یک API ابری. این برای جریان‌های کاری حساس به حریم خصوصی، برنامه‌های کاربردی حساس به تأخیر، و هر سناریویی که در آن اتصال شبکه نامطمئن است، اهمیت دارد.

Bonsai 27B اکنون تحت مجوز Apache 2.0 در دسترس است و آن را برای استفاده تجاری رایگان می‌سازد. به گزارش PrismML، این نقطه عطفی در تلاش مستمر برای در دسترس قرار دادن قابلیت‌های مدل‌های بزرگ بدون زیرساخت ابری است.

Originally reported by PrismML. Read the original article for additional details.

View original source
اشتراک‌گذاری: