Black Forest Labs مدل FLUX 3 را عرضه کرد؛ اولین مدل ویدیویی با خروجی صوتی بومی

Black Forest Labs امروز FLUX 3 را عرضه کرد و این اقدام نشاندهنده نخستین ورود این آزمایشگاه AI مستقر در فرایبورگ به حوزه تولید ویدیو است. این مدل کلیپهای ویدیویی تا ۲۰ ثانیه با خروجی صوتی بومی همگامسازیشده تولید میکند — هر دو بهطور مشترک از یک پرامپت واحد با استفاده از یک معماری یکپارچه ساخته میشوند، نه از طریق هماهنگسازی مدلهای جداگانه تصویر و صدا پشت یک API مشترک.
این تمایز اهمیت دارد. بیشتر محصولات تولید ویدیوی امروزی از اجزای جداگانه تشکیل شدهاند: یک رمزگذار متن، یک مدل انتشار ویدیو، و یک مدل صوتی مجزا که به هم دوخته شدهاند. FLUX 3 بر پایه Self-Flow ساخته شده است؛ این معماری اختصاصی BFL برای آموزش همزمان روی تصاویر، ویدیو، و صدا طراحی شده — به همین دلیل مدل یک بازنمایی مشترک از ساختار فضایی، فیزیک حرکت، و علیت صوتی توسعه میدهد. به گفته این شرکت، همین سیگنال آموزشی متقابل است که باعث میشود وزنهای یکسان بتوانند هم یک کلیپ فیلم فوتورئالیستی و هم یک وظیفه دستکاری با بازوی رباتیک را اجرا کنند.
آنچه امروز عرضه میشود
FLUX 3 در چهار خط محصول عرضه میشود. FLUX 3 Video و FLUX 3 Action امروز وارد برنامه Early Access محدود میشوند. FLUX 3 Image در هفتههای آینده بهصورت عمومی منتشر خواهد شد. FLUX 3 Dev، نسخه open-weight از بکبون multimodal، برای اواخر امسال وعده داده شده اما تاریخ قطعی ندارد.
FLUX 3 Video از text-to-video، تبدیل تصویر به ویدیو، انتقال سبک ویدیو به ویدیو، انتقالهای کنترلشده با keyframe، تولید دیالوگ چندزبانه، و زنجیرهسازی agentic کلیپهای مجزا به دنبالههای طولانیتر پشتیبانی میکند. تمام خروجیهای ویدیویی شامل صدای بومی هستند. FLUX 3 Action همین معماری را به ادراک رباتیک و کنترل فیزیکی گسترش میدهد.
نتایج benchmark، با چند نکته
BFL ارزیابیهای اولیه ترجیحی FLUX 3 Video را در برابر هفت رقیب روی کلیپهای text-to-video با کیفیت ۷۲۰p و مدت ۱۰ ثانیه منتشر کرد. FLUX 3 در ۹۳٪ از مقایسهها نسبت به Luma Ray 3.2، در ۷۷٪ نسبت به Runway Gen-4.5، در ۶۹٪ نسبت به Grok Imagine Video، در ۶۰٪ نسبت به Kling v3 Pro، در ۵۹٪ نسبت به Happy Horse v1، و در ۵۲٪ نسبت به هریک از Seedance 2.0 و Google Gemini Omni Flash ترجیح داده شد.
BFL این نتایج را بهعنوان ارزیابی مقدماتی از یک نسخه اولیه توصیف میکند. روششناسی کامل و جداول benchmark در زمان عرضه عمومی وعده داده شده است. دو مقایسه تنگاتنگ ۵۲٪ — در برابر Seedance 2.0 (که عرضه بینالمللی آن به دلیل دعوای حقوقی حق مؤلف متوقف شده) و Gemini Omni Flash — برای خریداران سازمانی غربی بیشترین اهمیت را دارند.
آنچه هنوز وجود ندارد
در زمان عرضه، هیچ API عمومی یا اطلاعات قیمتگذاریای اعلام نشده است. BFL هنوز وزنهای قابل دانلود را منتشر نکرده است. FLUX 3 Dev آخرین مرحله از برنامه عرضه BFL است و پس از رسیدن Image به مرحله عرضه عمومی ارائه میشود. این رویکرد با نسخههای FLUX 1.x متفاوت است؛ در آن نسخهها وزنهای open-weight همزمان با دسترسی تجاری ارائه شدند و پذیرش گسترده اشخاص ثالث را به همراه داشتند.
چرا این موضوع اهمیت دارد
FLUX 1.x در سالهای ۲۰۲۴ و ۲۰۲۵ به بکبون پیشفرض تولید تصویر open-weight برای بخش بزرگی از محصولات AI مصرفکننده و توسعهدهنده تبدیل شد. یک جانشین multimodal معتبر که در نهایت وزنهای open-weight عرضه کند، این جایگاه را به حوزه ویدیو و رباتیک گسترش خواهد داد. درخواستهای Early Access برای FLUX 3 Video در bfl.ai پذیرفته میشود. انتظار میرود FLUX 3 Image در هفتههای آینده بهصورت عمومی عرضه شود، آنطور که VentureBeat نخستینبار گزارش داد.
Originally reported by Black Forest Labs. Read the original article for additional details.
View original source