Thinking Machines مدل Inkling Small را با عملکردی همارز مدل پرچمدار و یکچهارم توان محاسباتی منتشر کرد

شرکت Thinking Machines Lab، استارتاپ هوش مصنوعی که توسط میرا موراتی، مدیر ارشد فناوری سابق OpenAI تأسیس شد، روز چهارشنبه مدل open-source Inkling-Small را منتشر کرد؛ مدلی با ۲۷۶ میلیارد پارامتر که در شاخص هوش مصنوعی Artificial Analysis تنها یک امتیاز با مدل قبلی خود با ۹۷۵ میلیارد پارامتر فاصله دارد، در حالی که تنها ۱۲ میلیارد پارامتر فعال در هر Token پردازش میکند.
این انتشار تنها دو هفته پس از معرفی اولیه Inkling صورت میگیرد و Thinking Machines را به یکی از سریعترین آزمایشگاههایی تبدیل میکند که نسخهای کارآمد از یک مدل پرچمدار با عملکردی نزدیک به نسخه اصلی عرضه کرده است. Inkling-Small از معماری Mixture-of-Experts (MoE) استفاده میکند؛ به این معنا که تنها بخشی از ۲۷۶ میلیارد پارامتر کل آن در هر گذر رو به جلو فعال میشود که هزینه محاسباتی و تأخیر استنتاج را کاهش میدهد، بدون آنکه افت عملکرد کامل یک مدل متراکم کوچکتر را داشته باشد.
Inkling Small چه کارهایی میتواند انجام دهد؟
این مدل ورودیهای متنی، تصویری و صوتی را میپذیرد و خروجی متنی تولید میکند. از پنجره زمینهای تا یک میلیون Token پشتیبانی میکند — همانند Inkling — و از همان سازوکار متغیر تلاش فکری بهره میبرد که به توسعهدهندگان امکان میدهد سرعت پاسخدهی را در برابر عمق استدلال مبادله کنند. Inkling-Small روی سیستمهای NVIDIA GB300 NVL72 آموزش دیده است و در Benchmarkهای Terminal-Bench 2.1 (استفاده عاملگونه از ابزار)، HLE (استدلال) و IFBench (پیروی از دستورات) در سطح ۱۲ میلیارد پارامتر فعال، عملکردی رقابتی در میان سایر مدلهای open-source دارد.
وزنهای کامل مدل تحت مجوز Apache 2.0 در Hugging Face در دسترس است که استفاده تجاری، اصلاح و توزیع مجدد را بدون پرداخت حق امتیاز مجاز میکند. Thinking Machines همچنین پشتیبانی از Fine-tuning را از طریق API خود به نام Tinker اضافه کرده است و در زمان عرضه، تخفیف ۵۰ درصدی برای استفاده از API از طریق رابط Tinker Playground ارائه میدهد.
چرا شرکتهای بزرگ باید به این موضوع توجه کنند؟
مدل اصلی Inkling با ۹۷۵ میلیارد پارامتر کل (۴۱ میلیارد پارامتر فعال) به زیرساخت جدی GPU نیاز دارد. Inkling-Small شمار پارامترهای فعال را به ۱۲ میلیارد در هر Token کاهش میدهد — یعنی ۷۰ درصد کاهش محاسبات هر استنتاج — در حالی که بخش عمدهای از عملکرد برنامهنویسی، استدلال و چندوجهی مدل پرچمدار را حفظ میکند. این مدل همچنان برای یک ایستگاه کاری مصرفکننده بیش از حد بزرگ است، اما برای شرکتهایی که ظرفیت GPU دارند و زیرساخت ابرمقیاس اجرا نمیکنند، بهطور قابل توجهی در دسترس قرار میگیرد.
کاهش فاصله بین ۹۷۵ میلیارد و ۲۷۶ میلیارد پارامتر، همراه با امتیازهای Benchmark که تقریباً تغییر نمیکنند، نشاندهنده روند گستردهتری از بهرهوری در توسعه هوش مصنوعی است: آزمایشگاهها بهطور فزاینده ثابت میکنند که معماریهای MoE میتوانند قابلیتهای کلاس پرچمدار را با هزینه سرویسدهی بهمراتب پایینتر ارائه دهند. این پویایی بر ارائهدهندگان API بسته و سایر آزمایشگاههای open-source فشار وارد میکند. Thinking Machines در اوایل سال ۲۰۲۵ توسط موراتی پس از جدایی از OpenAI تأسیس شد و سرمایهگذاری قابل توجهی از سوی سرمایهگذاران خطرپذیر جذب کرده است.
Originally reported by Thinking Machines Lab. Read the original article for additional details.
View original source