Black Forest Labs lança FLUX 3, seu primeiro modelo de vídeo com saída nativa de áudio

A Black Forest Labs lançou hoje o FLUX 3, marcando a primeira investida do laboratório de IA baseado em Freiburg na geração de vídeo. O modelo produz clipes de até 20 segundos com saída de áudio nativa sincronizada — ambos gerados conjuntamente a partir de um único prompt usando uma arquitetura unificada, em vez de rotear modelos separados de imagem e áudio por trás de uma API comum.
A distinção é importante. A maioria dos produtos de geração de vídeo atuais são montagens: um codificador de texto, um modelo de difusão de vídeo e um modelo de áudio separado costurados juntos. O FLUX 3 é construído sobre o Self-Flow, a arquitetura da BFL para treinamento simultâneo em imagens, vídeo e áudio, de modo que o modelo desenvolve uma representação compartilhada de estrutura espacial, física de movimento e causalidade acústica. Segundo a empresa, esse sinal de treinamento mútuo é o motivo pelo qual os mesmos pesos podem alimentar tanto um clipe fotorrealista quanto uma tarefa de manipulação em um braço robótico.
O que chega hoje
O FLUX 3 é lançado em quatro linhas de produto. O FLUX 3 Video e o FLUX 3 Action entram hoje em um programa de Early Access com restrições. O FLUX 3 Image será lançado publicamente nas próximas semanas. O FLUX 3 Dev, uma versão open-weight do backbone multimodal, está prometido para o final deste ano, mas sem data confirmada.
O FLUX 3 Video suporta text-to-video, image-to-video, transferência de estilo video-to-video, transições controladas por keyframe, geração de diálogo multilíngue e encadeamento agentic de clipes individuais em sequências mais longas. Todas as saídas de vídeo incluem áudio nativo. O FLUX 3 Action estende a mesma arquitetura para percepção robótica e controle físico.
Resultados de benchmark, com ressalvas
A BFL publicou avaliações preliminares de preferência para o FLUX 3 Video contra sete concorrentes em clipes de 10 segundos e 720p text-to-video. O FLUX 3 foi preferido ao Luma Ray 3.2 em 93% das comparações, ao Runway Gen-4.5 em 77%, ao Grok Imagine Video em 69%, ao Kling v3 Pro em 60%, ao Happy Horse v1 em 59%, e ao Seedance 2.0 e Google Gemini Omni Flash, ambos com 52%.
A BFL classifica esses resultados como uma avaliação preliminar de um candidato inicial. Metodologia completa e tabelas de benchmark são prometidas na disponibilidade geral. As duas comparações mais apertadas — 52% contra Seedance 2.0 (cujo lançamento internacional está suspenso devido a litígios de direitos autorais) e Gemini Omni Flash — são as mais relevantes para compradores empresariais ocidentais.
O que está faltando
Não há API pública no lançamento e nem preços definidos. A BFL não liberou pesos para download. O FLUX 3 Dev é o último na sequência de lançamento da BFL, chegando após o Image atingir disponibilidade geral. Essa sequência difere dos lançamentos FLUX 1.x, onde os pesos abertos chegaram junto com o acesso comercial e impulsionaram uma ampla adoção por terceiros.
Por que isso importa
O FLUX 1.x se tornou o backbone de geração de imagens open-weight padrão para uma grande parcela dos produtos de IA para consumidores e desenvolvedores em 2024 e 2025. Um sucessor multimodal crível que eventualmente libere pesos abertos expandiria essa presença para vídeo e robótica. As inscrições para o Early Access do FLUX 3 Video estão abertas em bfl.ai. A disponibilidade geral do FLUX 3 Image é esperada nas próximas semanas, conforme noticiado primeiro pelo VentureBeat.
Originally reported by Black Forest Labs. Read the original article for additional details.
View original source