نموذج Qwen3.8-Omni-Flash من علي بابا يخفض تكاليف الذكاء الاصطناعي السمعي البصري بأكثر من 90%

أطلق فريق Qwen التابع لعلي بابا في 18 سبتمبر نموذج Qwen3.8-Omni-Flash، وهو نموذج متعدد الوسائط أصلي يتعامل مع النص والصور والصوت والفيديو في مسار عمل موحد واحد بدلاً من توجيه أنواع الوسائط المختلفة عبر نماذج متخصصة منفصلة. يتوفر الإصدار فوراً عبر Qwen Chat وQwenCloud وواجهة برمجة تطبيقات Model Studio.
ما الذي يغيره "متعدد الوسائط الأصلي" فعلياً
تعمل العديد من أنظمة الذكاء الاصطناعي متعددة الوسائط عن طريق ربط نماذج منفصلة معاً: نموذج رؤية يصف صورة، ونموذج نسخ يحول الصوت إلى نص، ونموذج لغوي يفكر في المخرجات المجمعة. بدلاً من ذلك، يعالج Qwen3.8-Omni-Flash جميع أنواع الإدخال هذه ضمن مرور نموذج واحد.
يدعم النموذج نافذة سياق بمليون رمز، مما يضعه في نفس فئة أطول النماذج ذات السياق المتاحة حالياً، ويضيف وضع التفكير واستدعاء الأدوات والبحث على الويب كقدرات أصلية.
أرقام الاختبار المعياري والتسعير
تقول علي بابا إن النموذج حسّن درجته المتوسطة بأكثر من 26% عبر 30 تقييماً مقارنة بسابقه، Qwen3.5-Omni-Plus، مع تركز أكبر المكاسب في مهام وكلاء الصوت والفيديو والبرمجة ومعالجة السياق الطويل والتفاعل متعدد الوسائط في الوقت الفعلي. من ناحية التسعير، تُدرج QwenCloud سعر Qwen3.8-Omni-Flash بـ 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج.
التوفر الإقليمي وفجوة الأوزان المفتوحة
يُدرج النموذج كمتاح في مناطق بكين وسنغافورة وهونغ كونغ وطوكيو وفرانكفورت وفرجينيا. من الجدير بالذكر أن علي بابا لم تصدر أوزاناً مفتوحة لهذا النموذج عند الإطلاق، مما يعني أن الاستضافة الذاتية ليست خياراً متاحاً — وهو ابتعاد عن استراتيجية الأوزان المفتوحة التي ساعدت عدة نماذج Qwen سابقة من علي بابا على اكتساب قبول بين المطورين.
وردت في الأصل عن TechNode. اقرأ المقال الأصلي لمزيد من التفاصيل.
عرض المصدر الأصلي