PrismML مدل هوش مصنوعی ۲۷ میلیارد پارامتری را در ۳.۹ گیگابایت جای میدهد — آنقدر کوچک که در آیفون جا میشود

PrismML مدل Bonsai 27B را منتشر کرده است، مدلی مبتنی بر Qwen3.6 27B که به گفته این شرکت اولین هوش مصنوعی با ۲۷ میلیارد پارامتر است که به راحتی در یک گوشی جا میگیرد. این دستاورد از طریق کوانتیزاسیون شدید وزن ممکن شده است: به جای ذخیره هر پارامتر به صورت یک عدد اعشاری ۱۶ بیتی، Bonsai 27B از وزنهای باینری {−۱, +۱} استفاده میکند — فقط یک بیت به ازای هر پارامتر — تا مدلی را که در غیر این صورت ۵۴ گیگابایت حافظه مصرف میکرد، به ۳.۹ گیگابایت فشرده کند، اندازهای به قدر کافی کوچک که در محدوده حافظه یک آیفون ۱۷ پرو اجرا شود.
تاکنون، رده ۲۷ میلیارد پارامتری کاملاً در قلمرو لپتاپ یا سرور قرار داشت. حتی کوانتیزاسیون تهاجمی ۴ بیتی یک مدل ۲۷ میلیارد پارامتری حدود ۱۸ گیگابایت حجم دارد — که برای هر گوشی هوشمند فعلی بسیار بزرگ است. روش PrismML فشردهسازی را بسیار فراتر میبرد بدون افت کیفیت فاجعهبار، با تکیه بر تکنیکهایی که شرکت در انتشارات قبلی ۱ بیتی و سهتایی در مقیاسهای کوچکتر نشان داده بود.
دو نسخه، دو کاربرد
Bonsai 27B در دو پیکربندی عرضه میشود:
- Bonsai 27B سهتایی (۵.۹ گیگابایت): از وزنهای سهتایی {−۱, ۰, +۱} با ۱.۷۱ بیت مؤثر به ازای هر وزن استفاده میکند. این نسخه کیفیتمحور است و لپتاپهای روزمره را هدف قرار میدهد و ۹۵٪ از عملکرد مدل کامل را حفظ میکند.
- Bonsai 27B یک بیتی (۳.۹ گیگابایت): از وزنهای باینری {−۱, +۱} با ۱.۱۲۵ بیت مؤثر به ازای هر وزن استفاده میکند. این نسخه گوشیها را هدف قرار میدهد و در محدوده حافظه آیفون ۱۷ پرو جا میگیرد و ۹۰٪ از عملکرد مدل کامل را حفظ میکند.
هر دو نسخه از پشتیبانی چندوجهی (multimodal) برخوردارند، با برج دیداری (vision tower) که به صورت فشرده ۴ بیتی ارائه شده است. آنها یک پنجره زمینه کامل ۲۶۲ هزار توکنی دارند، از رمزگشایی حدسی (speculative decoding) برای استنتاج سریعتر پشتیبانی میکنند، و فراخوانیهای ابزار چندمرحلهای و حلقههای عاملی (agentic loops) را مدیریت میکنند — همان نوع بارهای کاری پایدار که مدلهای رویدستگاه در گذشته با مشکل مواجه میشدند.
تصویر بنچمارکها
PrismML هر دو نسخه را در ۱۵ آزمون در حالت تفکر (thinking mode) بنچمارک کرد. امتیازات ریاضی و کدنویسی تقریباً تحت تأثیر قرار نگرفتهاند: مدل سهتایی در ریاضی ۹۳.۴ امتیاز در مقابل ۹۵.۳ خط پایه، و مدل یک بیتی ۹۱.۷ را حفظ میکند. وظایف فراخوانی ابزار و عاملی (agentic) تأثیر فشردهسازی بیشتری نشان میدهند — مدل یک بیتی ۶۶.۰ امتیاز در مقابل ۸۰.۰ خط پایه — اما PrismML اشاره میکند که اینها همچنان از نسخههای ۴ بیتی معمولی همان مدل پایه بهتر عمل میکنند در حالی که ۲.۵ برابر حافظه کمتری اشغال میکنند.
این شرکت این موضوع را بر حسب «چگالی هوش» (intelligence density) — عملکرد به ازای هر گیگابایت — قاببندی میکند، جایی که Bonsai 27B یک بیتی به ۰.۵۳ به ازای هر گیگابایت دست مییابد، که تقریباً ۱۰ برابر خط پایه مدل کامل و ۲.۷ برابر بهترین جایگزین کمبیت معمولی است.
چرا برای هوش مصنوعی عاملی مهم است
نتیجه عملی این است که وظایفی که نیازمند یک مدل استدلال توانمند هستند — تحلیل اسناد، استخراج دادههای ساختیافته، تولید کد چندمرحلهای — اکنون میتوانند کاملاً روی دستگاه اجرا شوند، بدون ارسال داده به یک API ابری. این برای جریانهای کاری حساس به حریم خصوصی، برنامههای کاربردی حساس به تأخیر، و هر سناریویی که در آن اتصال شبکه نامطمئن است، اهمیت دارد.
Bonsai 27B اکنون تحت مجوز Apache 2.0 در دسترس است و آن را برای استفاده تجاری رایگان میسازد. به گزارش PrismML، این نقطه عطفی در تلاش مستمر برای در دسترس قرار دادن قابلیتهای مدلهای بزرگ بدون زیرساخت ابری است.
Originally reported by PrismML. Read the original article for additional details.
View original source