Black Forest Labs مدل FLUX 3 را عرضه کرد؛ اولین مدل ویدیویی با خروجی صوتی بومی

Black Forest Labs
اشتراک‌گذاری:
Black Forest Labs مدل FLUX 3 را عرضه کرد؛ اولین مدل ویدیویی با خروجی صوتی بومی

Black Forest Labs امروز FLUX 3 را عرضه کرد و این اقدام نشان‌دهنده نخستین ورود این آزمایشگاه AI مستقر در فرایبورگ به حوزه تولید ویدیو است. این مدل کلیپ‌های ویدیویی تا ۲۰ ثانیه با خروجی صوتی بومی همگام‌سازی‌شده تولید می‌کند — هر دو به‌طور مشترک از یک پرامپت واحد با استفاده از یک معماری یکپارچه ساخته می‌شوند، نه از طریق هماهنگ‌سازی مدل‌های جداگانه تصویر و صدا پشت یک API مشترک.

این تمایز اهمیت دارد. بیشتر محصولات تولید ویدیوی امروزی از اجزای جداگانه تشکیل شده‌اند: یک رمزگذار متن، یک مدل انتشار ویدیو، و یک مدل صوتی مجزا که به هم دوخته شده‌اند. FLUX 3 بر پایه Self-Flow ساخته شده است؛ این معماری اختصاصی BFL برای آموزش همزمان روی تصاویر، ویدیو، و صدا طراحی شده — به همین دلیل مدل یک بازنمایی مشترک از ساختار فضایی، فیزیک حرکت، و علیت صوتی توسعه می‌دهد. به گفته این شرکت، همین سیگنال آموزشی متقابل است که باعث می‌شود وزن‌های یکسان بتوانند هم یک کلیپ فیلم فوتورئالیستی و هم یک وظیفه دستکاری با بازوی رباتیک را اجرا کنند.

آنچه امروز عرضه می‌شود

FLUX 3 در چهار خط محصول عرضه می‌شود. FLUX 3 Video و FLUX 3 Action امروز وارد برنامه Early Access محدود می‌شوند. FLUX 3 Image در هفته‌های آینده به‌صورت عمومی منتشر خواهد شد. FLUX 3 Dev، نسخه open-weight از بکبون multimodal، برای اواخر امسال وعده داده شده اما تاریخ قطعی ندارد.

FLUX 3 Video از text-to-video، تبدیل تصویر به ویدیو، انتقال سبک ویدیو به ویدیو، انتقال‌های کنترل‌شده با keyframe، تولید دیالوگ چندزبانه، و زنجیره‌سازی agentic کلیپ‌های مجزا به دنباله‌های طولانی‌تر پشتیبانی می‌کند. تمام خروجی‌های ویدیویی شامل صدای بومی هستند. FLUX 3 Action همین معماری را به ادراک رباتیک و کنترل فیزیکی گسترش می‌دهد.

نتایج benchmark، با چند نکته

BFL ارزیابی‌های اولیه ترجیحی FLUX 3 Video را در برابر هفت رقیب روی کلیپ‌های text-to-video با کیفیت ۷۲۰p و مدت ۱۰ ثانیه منتشر کرد. FLUX 3 در ۹۳٪ از مقایسه‌ها نسبت به Luma Ray 3.2، در ۷۷٪ نسبت به Runway Gen-4.5، در ۶۹٪ نسبت به Grok Imagine Video، در ۶۰٪ نسبت به Kling v3 Pro، در ۵۹٪ نسبت به Happy Horse v1، و در ۵۲٪ نسبت به هریک از Seedance 2.0 و Google Gemini Omni Flash ترجیح داده شد.

BFL این نتایج را به‌عنوان ارزیابی مقدماتی از یک نسخه اولیه توصیف می‌کند. روش‌شناسی کامل و جداول benchmark در زمان عرضه عمومی وعده داده شده است. دو مقایسه تنگاتنگ ۵۲٪ — در برابر Seedance 2.0 (که عرضه بین‌المللی آن به دلیل دعوای حقوقی حق مؤلف متوقف شده) و Gemini Omni Flash — برای خریداران سازمانی غربی بیشترین اهمیت را دارند.

آنچه هنوز وجود ندارد

در زمان عرضه، هیچ API عمومی یا اطلاعات قیمت‌گذاری‌ای اعلام نشده است. BFL هنوز وزن‌های قابل دانلود را منتشر نکرده است. FLUX 3 Dev آخرین مرحله از برنامه عرضه BFL است و پس از رسیدن Image به مرحله عرضه عمومی ارائه می‌شود. این رویکرد با نسخه‌های FLUX 1.x متفاوت است؛ در آن نسخه‌ها وزن‌های open-weight همزمان با دسترسی تجاری ارائه شدند و پذیرش گسترده اشخاص ثالث را به همراه داشتند.

چرا این موضوع اهمیت دارد

FLUX 1.x در سال‌های ۲۰۲۴ و ۲۰۲۵ به بکبون پیش‌فرض تولید تصویر open-weight برای بخش بزرگی از محصولات AI مصرف‌کننده و توسعه‌دهنده تبدیل شد. یک جانشین multimodal معتبر که در نهایت وزن‌های open-weight عرضه کند، این جایگاه را به حوزه ویدیو و رباتیک گسترش خواهد داد. درخواست‌های Early Access برای FLUX 3 Video در bfl.ai پذیرفته می‌شود. انتظار می‌رود FLUX 3 Image در هفته‌های آینده به‌صورت عمومی عرضه شود، آن‌طور که VentureBeat نخستین‌بار گزارش داد.

Originally reported by Black Forest Labs. Read the original article for additional details.

View original source
اشتراک‌گذاری: