جوجل تطلق نموذج Gemini Omni Flash لتوليد الفيديو للمطورين بسعر 0.10 دولار لكل ثانية

أعلنت جوجل رسميًا عن إتاحة نموذجها Gemini Omni Flash للمطورين والعملاء المؤسسيين عبر Gemini API وGoogle AI Studio، وفقًا لما ذكرته VentureBeat. يمثل الإطلاق في 30 يونيو 2026 انتقال النموذج من المعاينة الاستهلاكية – التي عُرضت لأول مرة في Google I/O في مايو – إلى أداة جاهزة للإنتاج للشركات التي تبني مهام سير عمل فيديو على نطاق واسع.
يولد النموذج فيديو بدقة 720p بسعر 0.10 دولار لكل ثانية، وهو ما يعادل طبقة Veo 3.1 Fast ولكنه يقل بشكل كبير عن السعر القياسي لـ Veo 3.1 البالغ 0.40 دولار لكل ثانية. هذا التخفيض بنسبة 75% يجعل مقطعًا مدته عشر ثوانٍ بتكلفة دولار واحد تقريبًا – وهو تحول كبير لفرق التطوير والتسويق التي وجدت سابقًا أن تكلفة فيديو الذكاء الاصطناعي باهظة على نطاق واسع.
التحرير الحواري يغير سير عمل الإنتاج
القدرة الرئيسية ليست التوليد نفسه – بل التحرير التكراري الحواري. تم بناء Omni Flash على واجهة التفاعلات الجديدة من جوجل، وهي واجهة ذات حالة مصممة للمهام متعددة الخطوات، مما يسمح للمستخدمين بوصف التغييرات بلغة عادية ويقوم النموذج بتطبيقها على مقطع موجود دون الحاجة إلى التوليد من الصفر. يمكن للمسوق إعادة إضاءة لقطة منتج، أو إعادة تأطير مشهد، أو تغيير تفاصيل الملابس من خلال سلسلة من التعليمات باللغة الطبيعية، مع الحفاظ على ما يعمل بالفعل.
هذا يدمج ما كان سابقًا خط أنابيب من خمس أدوات – نماذج LLM منفصلة لكتابة السيناريو، ومولدات الصور، ونماذج الفيديو، وأدوات محاكاة الشفاه، ومولدات الصوت – في نموذج واحد يقبل النصوص والصور والفيديو كمدخلات ويقدم مقطعًا نهائيًا مع صوت متزامن.
الميزات المؤسسية: أصول العلامات التجارية، وإدراج النص، وضوابط التزييف العميق
بالنسبة للفرق المؤسسية، يدعم Omni Flash المدخلات المرجعية متعددة الوسائط: قم بتغذية النموذج بصورة منتج أو شعار علامة تجارية مع تعليمات نصية، ويقوم النموذج بدمج الأصل الحقيقي في المشهد المولد بدلاً من اختراع عنصر نائب عام. كما يتعامل النموذج مع النص واللافتات داخل المشهد – وهو مفيد لمقاطع الفيديو التدريبية المترجمة أو الإعلانات التي تحتاج إلى وضع الشعارات في سياقها.
بنيت جوجل حدودًا صريحة ضد سوء الاستخدام. يرفض النموذج محاكاة الشفاه لصورة ثابتة لشخص مع مسار صوتي – وهو إجراء مباشر ضد التزييف العميق. ولكنه يترجم الكلام الموجود في الفيديو إلى لغات أخرى، وهو مفيد للمؤسسات التي لديها فرق متعددة اللغات. يحمل كل ناتج علامة SynthID المائية من جوجل، وتقوم الشركة بتوسيع شهادات محتوى C2PA عبر أدواتها التوليدية للفيديو.
القيود الحالية جديرة بالملاحظة: المقاطع محدودة بـ 10 ثوانٍ، ويخرج النموذج بدقة 720p فقط – بدون خيار 1080p أو 4K. الفرق التي تحتاج محتوى أطول يجب أن تقوم بتجميع المقاطع معًا، والأعمال المتميزة للعلامات التجارية التي تتطلب دقة عالية يجب أن تلجأ إلى طبقات Veo 3.1 بدلاً من ذلك.
السياق التنافسي: سورا اختفت، رانوي تراقب
يأتي إطلاق API في وقت أوقفت فيه OpenAI منتجها الخاص للتحويل من نص إلى فيديو، Sora، ولا تزال Runway البديل المستقل الرائد في سوق فيديو الذكاء الاصطناعي المؤسسي. تمثل تسعيرة جوجل وزاوية التحرير الحواري خطوة مباشرة نحو القطاع المؤسسي الذي استهدفته تلك المنافسين.
للمطورين المستقلين والفرق الصغيرة بشكل خاص، يعني معدل 0.10 دولار/ثانية على مستوى API أن توليد الفيديو أصبح الآن مجديًا اقتصاديًا لمهام سير العمل النموذجية والأدوات الداخلية التي لن تبرر تكاليف اشتراك Runway أو تعقيد ربط عدة أدوات منفصلة.
يتوفر Gemini Omni Flash الآن عبر Gemini API وGoogle AI Studio. يمكن للمطورين الوصول إلى بطاقة النموذج والمواصفات الفنية من خلال وثائق Google DeepMind المنشورة.
Originally reported by VentureBeat. Read the original article for additional details.
View original source