گوگل ویدیو تولیدی Gemini Omni Flash را با قیمت ۰٫۱۰ دلار در هر ثانیه در اختیار توسعه‌دهندگان قرار داد

VentureBeat
اشتراک‌گذاری:
گوگل ویدیو تولیدی Gemini Omni Flash را با قیمت ۰٫۱۰ دلار در هر ثانیه در اختیار توسعه‌دهندگان قرار داد

به گزارش VentureBeat، گوگل مدل Gemini Omni Flash خود را به طور رسمی از طریق Gemini API و Google AI Studio در اختیار توسعه‌دهندگان و مشتریان سازمانی قرار داده است. انتشار این مدل در ۳۰ ژوئن ۲۰۲۶ نشان‌دهنده گذار آن از پیش‌نمایش مصرف‌کننده – که نخستین بار در Google I/O در ماه مه نمایش داده شد – به ابزاری آماده برای تولید برای کسب‌وکارهایی است که در مقیاس بزرگ workflow ویدیویی می‌سازند.

این مدل ویدیوی 720p را با قیمت ۰٫۱۰ دلار در هر ثانیه تولید می‌کند که با سطح Veo 3.1 Fast برابری می‌کند، اما به شدت از قیمت استاندارد Veo 3.1 که ۰٫۴۰ دلار در هر ثانیه است پایین‌تر است. این کاهش قیمت ۷۵ درصدی، یک کلیپ ده ثانیه‌ای را تقریباً ۱ دلار قرار می‌دهد – تغییری قابل توجه برای تیم‌های توسعه و بازاریابی که پیش از این تولید ویدیوی هوش مصنوعی را در مقیاس بزرگ از نظر هزینه غیرقابل توجیه می‌دانستند.

ویرایش مکالمه‌ای، workflow تولید را تغییر می‌دهد

قابلیت اصلی این مدل، خود تولید نیست – بلکه ویرایش تکراری و مکالمه‌ای است. Omni Flash که بر روی API تعاملات جدید گوگل ساخته شده است – یک رابط حالت‌دار طراحی‌شده برای وظایف چندمرحله‌ای – به کاربران اجازه می‌دهد تغییرات را به زبان ساده توصیف کرده و مدل آن‌ها را بر روی یک کلیپ موجود اعمال کند، بدون اینکه نیاز به تولید مجدد از ابتدا باشد. یک بازاریاب می‌تواند از طریق دنباله‌ای از دستورالعمل‌های زبان طبیعی، نوردهی یک عکس محصول را تغییر دهد، صحنه را دوباره قاب‌بندی کند یا جزئیات لباس را عوض کند و آنچه قبلاً کار می‌کرد را حفظ کند.

این قابلیت، آنچه را که قبلاً یک خط لوله پنج ابزاری بود – LLMهای جداگانه برای فیلم‌نامه‌نویسی، تولیدکننده‌های تصویر، مدل‌های ویدیویی، ابزارهای هماهنگ‌سازی لب و تولیدکننده‌های صدا – در یک مدل واحد ادغام می‌کند که متن، تصاویر و ویدیو را به عنوان ورودی می‌پذیرد و یک کلیپ نهایی با صدای هماهنگ‌سازی‌شده تحویل می‌دهد.

ویژگی‌های سازمانی: دارایی‌های برند، درج متن و موانع جعل عمیق

برای تیم‌های سازمانی، Omni Flash از ورودی‌های مرجع چندحالته پشتیبانی می‌کند: یک عکس محصول یا لوگوی برند را به همراه یک دستور متنی به مدل بدهید و مدل دارایی واقعی را به جای اختراع یک جایگزین عمومی، در صحنه تولیدشده ادغام می‌کند. این مدل همچنین متن و علائم درون صحنه را مدیریت می‌کند – که برای آموزش‌های محلی‌سازی‌شده و تبلیغاتی که نیاز به قرارگیری زمینه‌ای لوگوها دارند مفید است.

گوگل محدودیت‌های صریحی در برابر سوءاستفاده ایجاد کرده است. این مدل از هماهنگ‌سازی لب یک عکس ثابت از یک شخص با یک آهنگ صوتی خودداری می‌کند – اقدامی مستقیم علیه جعل عمیق. با این حال، گفتار موجود در ویدیو را به زبان‌های دیگر ترجمه می‌کند که برای سازمان‌های دارای تیم‌های چندزبانه مفید است. هر خروجی حاوی واترمارک SynthID گوگل است و این شرکت در حال گسترش اعتبارنامه محتوای C2PA در سراسر ابزارهای تولید ویدیوی خود است.

محدودیت‌های فعلی قابل ذکر هستند: کلیپ‌ها حداکثر ۱۰ ثانیه هستند و مدل تنها خروجی 720p ارائه می‌دهد – بدون گزینه 1080p یا 4K. تیم‌هایی که به محتوای طولانی‌تر نیاز دارند باید کلیپ‌ها را به هم متصل کنند و کارهای برند ممتاز که نیازمند خروجی با وضوح بالا هستند باید از سطوح Veo 3.1 استفاده کنند.

زمینه رقابتی: سورا حذف شد، رانوی در رصد

راه‌اندازی API در حالی انجام می‌شود که OpenAI محصول متن‌به‌ویدیوی خود، Sora، را متوقف کرده است و Runway همچنان رقیب مستقل پیشرو در بازار ویدیوی هوش مصنوعی سازمانی است. قیمت‌گذاری گوگل و زاویه ویرایش مکالمه‌ای، یک حرکت مستقیم برای بخش سازمانی است که آن رقبا هدف قرار داده بودند.

به ویژه برای توسعه‌دهندگان مستقل و تیم‌های کوچک، نرخ ۰٫۱۰ دلار در هر ثانیه در سطح API به این معناست که تولید ویدیو اکنون از نظر اقتصادی برای workflowهای نمونه اولیه و ابزارهای داخلی که هزینه اشتراک Runway یا پیچیدگی اتصال چندین ابزار نقطاتی را توجیه نمی‌کرد، مقرون‌به‌صرفه است.

Gemini Omni Flash اکنون از طریق Gemini API و Google AI Studio در دسترس است. توسعه‌دهندگان می‌توانند کارت مدل و مشخصات فنی را از طریق مستندات منتشرشده Google DeepMind دریافت کنند.

Originally reported by VentureBeat. Read the original article for additional details.

View original source
اشتراک‌گذاری: