Thinking Machines مدل Inkling Small را با عملکردی همارز مدل پرچمدار و یکچهارم توان محاسباتی منتشر کرد

Thinking Machines Lab
اشتراک‌گذاری:
Thinking Machines مدل Inkling Small را با عملکردی همارز مدل پرچمدار و یکچهارم توان محاسباتی منتشر کرد

شرکت Thinking Machines Lab، استارتاپ هوش مصنوعی که توسط میرا موراتی، مدیر ارشد فناوری سابق OpenAI تأسیس شد، روز چهارشنبه مدل open-source Inkling-Small را منتشر کرد؛ مدلی با ۲۷۶ میلیارد پارامتر که در شاخص هوش مصنوعی Artificial Analysis تنها یک امتیاز با مدل قبلی خود با ۹۷۵ میلیارد پارامتر فاصله دارد، در حالی که تنها ۱۲ میلیارد پارامتر فعال در هر Token پردازش میکند.

این انتشار تنها دو هفته پس از معرفی اولیه Inkling صورت می‌گیرد و Thinking Machines را به یکی از سریع‌ترین آزمایشگاه‌هایی تبدیل می‌کند که نسخه‌ای کارآمد از یک مدل پرچمدار با عملکردی نزدیک به نسخه اصلی عرضه کرده است. Inkling-Small از معماری Mixture-of-Experts (MoE) استفاده می‌کند؛ به این معنا که تنها بخشی از ۲۷۶ میلیارد پارامتر کل آن در هر گذر رو به جلو فعال می‌شود که هزینه محاسباتی و تأخیر استنتاج را کاهش می‌دهد، بدون آنکه افت عملکرد کامل یک مدل متراکم کوچک‌تر را داشته باشد.

Inkling Small چه کارهایی می‌تواند انجام دهد؟

این مدل ورودی‌های متنی، تصویری و صوتی را می‌پذیرد و خروجی متنی تولید می‌کند. از پنجره زمینه‌ای تا یک میلیون Token پشتیبانی می‌کند — همانند Inkling — و از همان سازوکار متغیر تلاش فکری بهره می‌برد که به توسعه‌دهندگان امکان می‌دهد سرعت پاسخ‌دهی را در برابر عمق استدلال مبادله کنند. Inkling-Small روی سیستم‌های NVIDIA GB300 NVL72 آموزش دیده است و در Benchmarkهای Terminal-Bench 2.1 (استفاده عامل‌گونه از ابزار)، HLE (استدلال) و IFBench (پیروی از دستورات) در سطح ۱۲ میلیارد پارامتر فعال، عملکردی رقابتی در میان سایر مدل‌های open-source دارد.

وزن‌های کامل مدل تحت مجوز Apache 2.0 در Hugging Face در دسترس است که استفاده تجاری، اصلاح و توزیع مجدد را بدون پرداخت حق امتیاز مجاز می‌کند. Thinking Machines همچنین پشتیبانی از Fine-tuning را از طریق API خود به نام Tinker اضافه کرده است و در زمان عرضه، تخفیف ۵۰ درصدی برای استفاده از API از طریق رابط Tinker Playground ارائه می‌دهد.

چرا شرکت‌های بزرگ باید به این موضوع توجه کنند؟

مدل اصلی Inkling با ۹۷۵ میلیارد پارامتر کل (۴۱ میلیارد پارامتر فعال) به زیرساخت جدی GPU نیاز دارد. Inkling-Small شمار پارامترهای فعال را به ۱۲ میلیارد در هر Token کاهش می‌دهد — یعنی ۷۰ درصد کاهش محاسبات هر استنتاج — در حالی که بخش عمده‌ای از عملکرد برنامه‌نویسی، استدلال و چندوجهی مدل پرچمدار را حفظ می‌کند. این مدل همچنان برای یک ایستگاه کاری مصرف‌کننده بیش از حد بزرگ است، اما برای شرکت‌هایی که ظرفیت GPU دارند و زیرساخت ابرمقیاس اجرا نمی‌کنند، به‌طور قابل توجهی در دسترس قرار می‌گیرد.

کاهش فاصله بین ۹۷۵ میلیارد و ۲۷۶ میلیارد پارامتر، همراه با امتیازهای Benchmark که تقریباً تغییر نمی‌کنند، نشان‌دهنده روند گسترده‌تری از بهره‌وری در توسعه هوش مصنوعی است: آزمایشگاه‌ها به‌طور فزاینده ثابت می‌کنند که معماری‌های MoE می‌توانند قابلیت‌های کلاس پرچمدار را با هزینه سرویس‌دهی به‌مراتب پایین‌تر ارائه دهند. این پویایی بر ارائه‌دهندگان API بسته و سایر آزمایشگاه‌های open-source فشار وارد می‌کند. Thinking Machines در اوایل سال ۲۰۲۵ توسط موراتی پس از جدایی از OpenAI تأسیس شد و سرمایه‌گذاری قابل توجهی از سوی سرمایه‌گذاران خطرپذیر جذب کرده است.

Originally reported by Thinking Machines Lab. Read the original article for additional details.

View original source
اشتراک‌گذاری: