Qwen3.8-Omni-Flash علیبابا هزینههای هوش مصنوعی صوتی-تصویری را بیش از ۹۰٪ کاهش میدهد

تیم Qwen علیبابا در ۱۸ سپتامبر Qwen3.8-Omni-Flash را منتشر کرد، مدلی چندوجهی بومی که متن، تصویر، صدا و ویدیو را در یک جریان کاری یکپارچه واحد مدیریت میکند، بهجای هدایت انواع رسانههای مختلف از طریق مدلهای تخصصی جداگانه. این نسخه بلافاصله از طریق Qwen Chat، QwenCloud و API استودیوی مدل در دسترس است.
«چندوجهی بومی» واقعاً چه چیزی را تغییر میدهد
بسیاری از سیستمهای هوش مصنوعی چندوجهی با زنجیر کردن مدلهای جداگانه کار میکنند: یک مدل بینایی تصویری را توصیف میکند، یک مدل رونویسی صدا را به متن تبدیل میکند و یک مدل زبانی روی خروجی ترکیبی استدلال میکند. در عوض Qwen3.8-Omni-Flash همه این انواع ورودی را در یک مرحله واحد مدل پردازش میکند.
این مدل از پنجره زمینه ۱ میلیون توکنی پشتیبانی میکند و آن را در همان رده طولانیترین مدلهای زمینهدار موجود قرار میدهد، و حالت تفکر، فراخوانی ابزار و جستجوی وب را بهعنوان قابلیتهای بومی اضافه میکند.
اعداد محک و قیمتگذاری
علیبابا میگوید این مدل امتیاز میانگین خود را بیش از ۲۶٪ در ۳۰ ارزیابی نسبت به نسخه قبلی، Qwen3.5-Omni-Plus، بهبود بخشیده است، با بیشترین دستاوردها در وظایف عامل صوتی-تصویری، کدنویسی، مدیریت زمینه طولانی و تعامل چندوجهی بلادرنگ متمرکز است. از نظر قیمتگذاری، QwenCloud قیمت Qwen3.8-Omni-Flash را ۰.۱۵ دلار به ازای هر میلیون توکن ورودی و ۰.۴۷ دلار به ازای هر میلیون توکن خروجی اعلام کرده است.
دسترسی منطقهای و شکاف وزنهای باز
این مدل در مناطق پکن، سنگاپور، هنگکنگ، توکیو، فرانکفورت و ویرجینیا در دسترس است. قابلتوجه است که علیبابا در زمان راهاندازی، وزنهای باز این مدل را منتشر نکرده است، به این معنی که میزبانی شخصی گزینهای نیست — انحرافی از استراتژی وزن باز که به چندین مدل قبلی Qwen علیبابا کمک کرد در میان توسعهدهندگان پذیرش پیدا کنند.
در ابتدا توسط TechNode گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.
مشاهدهٔ منبع اصلی