Qwen3.8-Omni-Flash علی‌بابا هزینه‌های هوش مصنوعی صوتی-تصویری را بیش از ۹۰٪ کاهش می‌دهد

TechNode
اشتراک‌گذاری:
Qwen3.8-Omni-Flash علی‌بابا هزینه‌های هوش مصنوعی صوتی-تصویری را بیش از ۹۰٪ کاهش می‌دهد

تیم Qwen علی‌بابا در ۱۸ سپتامبر Qwen3.8-Omni-Flash را منتشر کرد، مدلی چندوجهی بومی که متن، تصویر، صدا و ویدیو را در یک جریان کاری یکپارچه واحد مدیریت می‌کند، به‌جای هدایت انواع رسانه‌های مختلف از طریق مدل‌های تخصصی جداگانه. این نسخه بلافاصله از طریق Qwen Chat، QwenCloud و API استودیوی مدل در دسترس است.

«چندوجهی بومی» واقعاً چه چیزی را تغییر می‌دهد

بسیاری از سیستم‌های هوش مصنوعی چندوجهی با زنجیر کردن مدل‌های جداگانه کار می‌کنند: یک مدل بینایی تصویری را توصیف می‌کند، یک مدل رونویسی صدا را به متن تبدیل می‌کند و یک مدل زبانی روی خروجی ترکیبی استدلال می‌کند. در عوض Qwen3.8-Omni-Flash همه این انواع ورودی را در یک مرحله واحد مدل پردازش می‌کند.

این مدل از پنجره زمینه ۱ میلیون توکنی پشتیبانی می‌کند و آن را در همان رده طولانی‌ترین مدل‌های زمینه‌دار موجود قرار می‌دهد، و حالت تفکر، فراخوانی ابزار و جستجوی وب را به‌عنوان قابلیت‌های بومی اضافه می‌کند.

اعداد محک و قیمت‌گذاری

علی‌بابا می‌گوید این مدل امتیاز میانگین خود را بیش از ۲۶٪ در ۳۰ ارزیابی نسبت به نسخه قبلی، Qwen3.5-Omni-Plus، بهبود بخشیده است، با بیشترین دستاوردها در وظایف عامل صوتی-تصویری، کدنویسی، مدیریت زمینه طولانی و تعامل چندوجهی بلادرنگ متمرکز است. از نظر قیمت‌گذاری، QwenCloud قیمت Qwen3.8-Omni-Flash را ۰.۱۵ دلار به ازای هر میلیون توکن ورودی و ۰.۴۷ دلار به ازای هر میلیون توکن خروجی اعلام کرده است.

دسترسی منطقه‌ای و شکاف وزن‌های باز

این مدل در مناطق پکن، سنگاپور، هنگ‌کنگ، توکیو، فرانکفورت و ویرجینیا در دسترس است. قابل‌توجه است که علی‌بابا در زمان راه‌اندازی، وزن‌های باز این مدل را منتشر نکرده است، به این معنی که میزبانی شخصی گزینه‌ای نیست — انحرافی از استراتژی وزن باز که به چندین مدل قبلی Qwen علی‌بابا کمک کرد در میان توسعه‌دهندگان پذیرش پیدا کنند.

در ابتدا توسط TechNode گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.

مشاهدهٔ منبع اصلی
اشتراک‌گذاری: