گوگل ویدیو تولیدی Gemini Omni Flash را با قیمت ۰٫۱۰ دلار در هر ثانیه در اختیار توسعهدهندگان قرار داد

به گزارش VentureBeat، گوگل مدل Gemini Omni Flash خود را به طور رسمی از طریق Gemini API و Google AI Studio در اختیار توسعهدهندگان و مشتریان سازمانی قرار داده است. انتشار این مدل در ۳۰ ژوئن ۲۰۲۶ نشاندهنده گذار آن از پیشنمایش مصرفکننده – که نخستین بار در Google I/O در ماه مه نمایش داده شد – به ابزاری آماده برای تولید برای کسبوکارهایی است که در مقیاس بزرگ workflow ویدیویی میسازند.
این مدل ویدیوی 720p را با قیمت ۰٫۱۰ دلار در هر ثانیه تولید میکند که با سطح Veo 3.1 Fast برابری میکند، اما به شدت از قیمت استاندارد Veo 3.1 که ۰٫۴۰ دلار در هر ثانیه است پایینتر است. این کاهش قیمت ۷۵ درصدی، یک کلیپ ده ثانیهای را تقریباً ۱ دلار قرار میدهد – تغییری قابل توجه برای تیمهای توسعه و بازاریابی که پیش از این تولید ویدیوی هوش مصنوعی را در مقیاس بزرگ از نظر هزینه غیرقابل توجیه میدانستند.
ویرایش مکالمهای، workflow تولید را تغییر میدهد
قابلیت اصلی این مدل، خود تولید نیست – بلکه ویرایش تکراری و مکالمهای است. Omni Flash که بر روی API تعاملات جدید گوگل ساخته شده است – یک رابط حالتدار طراحیشده برای وظایف چندمرحلهای – به کاربران اجازه میدهد تغییرات را به زبان ساده توصیف کرده و مدل آنها را بر روی یک کلیپ موجود اعمال کند، بدون اینکه نیاز به تولید مجدد از ابتدا باشد. یک بازاریاب میتواند از طریق دنبالهای از دستورالعملهای زبان طبیعی، نوردهی یک عکس محصول را تغییر دهد، صحنه را دوباره قاببندی کند یا جزئیات لباس را عوض کند و آنچه قبلاً کار میکرد را حفظ کند.
این قابلیت، آنچه را که قبلاً یک خط لوله پنج ابزاری بود – LLMهای جداگانه برای فیلمنامهنویسی، تولیدکنندههای تصویر، مدلهای ویدیویی، ابزارهای هماهنگسازی لب و تولیدکنندههای صدا – در یک مدل واحد ادغام میکند که متن، تصاویر و ویدیو را به عنوان ورودی میپذیرد و یک کلیپ نهایی با صدای هماهنگسازیشده تحویل میدهد.
ویژگیهای سازمانی: داراییهای برند، درج متن و موانع جعل عمیق
برای تیمهای سازمانی، Omni Flash از ورودیهای مرجع چندحالته پشتیبانی میکند: یک عکس محصول یا لوگوی برند را به همراه یک دستور متنی به مدل بدهید و مدل دارایی واقعی را به جای اختراع یک جایگزین عمومی، در صحنه تولیدشده ادغام میکند. این مدل همچنین متن و علائم درون صحنه را مدیریت میکند – که برای آموزشهای محلیسازیشده و تبلیغاتی که نیاز به قرارگیری زمینهای لوگوها دارند مفید است.
گوگل محدودیتهای صریحی در برابر سوءاستفاده ایجاد کرده است. این مدل از هماهنگسازی لب یک عکس ثابت از یک شخص با یک آهنگ صوتی خودداری میکند – اقدامی مستقیم علیه جعل عمیق. با این حال، گفتار موجود در ویدیو را به زبانهای دیگر ترجمه میکند که برای سازمانهای دارای تیمهای چندزبانه مفید است. هر خروجی حاوی واترمارک SynthID گوگل است و این شرکت در حال گسترش اعتبارنامه محتوای C2PA در سراسر ابزارهای تولید ویدیوی خود است.
محدودیتهای فعلی قابل ذکر هستند: کلیپها حداکثر ۱۰ ثانیه هستند و مدل تنها خروجی 720p ارائه میدهد – بدون گزینه 1080p یا 4K. تیمهایی که به محتوای طولانیتر نیاز دارند باید کلیپها را به هم متصل کنند و کارهای برند ممتاز که نیازمند خروجی با وضوح بالا هستند باید از سطوح Veo 3.1 استفاده کنند.
زمینه رقابتی: سورا حذف شد، رانوی در رصد
راهاندازی API در حالی انجام میشود که OpenAI محصول متنبهویدیوی خود، Sora، را متوقف کرده است و Runway همچنان رقیب مستقل پیشرو در بازار ویدیوی هوش مصنوعی سازمانی است. قیمتگذاری گوگل و زاویه ویرایش مکالمهای، یک حرکت مستقیم برای بخش سازمانی است که آن رقبا هدف قرار داده بودند.
به ویژه برای توسعهدهندگان مستقل و تیمهای کوچک، نرخ ۰٫۱۰ دلار در هر ثانیه در سطح API به این معناست که تولید ویدیو اکنون از نظر اقتصادی برای workflowهای نمونه اولیه و ابزارهای داخلی که هزینه اشتراک Runway یا پیچیدگی اتصال چندین ابزار نقطاتی را توجیه نمیکرد، مقرونبهصرفه است.
Gemini Omni Flash اکنون از طریق Gemini API و Google AI Studio در دسترس است. توسعهدهندگان میتوانند کارت مدل و مشخصات فنی را از طریق مستندات منتشرشده Google DeepMind دریافت کنند.
Originally reported by VentureBeat. Read the original article for additional details.
View original source