Black Forest Labs lance FLUX 3, son premier modèle vidéo avec sortie audio native

Black Forest Labs a lancé FLUX 3 aujourd’hui, marquant la première incursion du laboratoire d’IA basé à Fribourg dans la génération vidéo. Le modèle produit des clips vidéo jusqu’à 20 secondes avec une sortie audio native synchronisée — le tout généré conjointement à partir d’une seule invite via une architecture unifiée, plutôt que de router des modèles d’image et audio séparés derrière une API commune.
La distinction a son importance. La plupart des produits de génération vidéo actuels sont des assemblages : un encodeur de texte, un modèle de diffusion vidéo et un modèle audio distinct cousus ensemble. FLUX 3 repose sur Self-Flow, l’architecture de BFL pour l’entraînement simultané sur les images, la vidéo et l’audio, permettant au modèle de développer une représentation partagée de la structure spatiale, de la physique du mouvement et de la causalité acoustique. Selon l’entreprise, ce signal d’entraînement mutuel explique pourquoi les mêmes poids peuvent alimenter à la fois un clip filmique photoréaliste et une tâche de manipulation dans un bras robotique.
Ce qui est lancé aujourd’hui
FLUX 3 est déployé sur quatre gammes de produits. FLUX 3 Video et FLUX 3 Action intègrent un programme d’accès anticipé (Early Access) sous conditions dès aujourd’hui. FLUX 3 Image sera déployé publiquement dans les semaines à venir. FLUX 3 Dev, une version open-weight du backbone multimodal, est prévue pour plus tard dans l’année mais sans date confirmée.
FLUX 3 Video prend en charge le texte-vers-vidéo, l’image-vers-vidéo, le transfert de style vidéo-vers-vidéo, les transitions contrôlées par keyframe, la génération de dialogues multilingues et l’enchaînement agentique de clips individuels en séquences plus longues. Toutes les sorties vidéo incluent un audio natif. FLUX 3 Action étend la même architecture à la perception robotique et au contrôle physique.
Résultats de benchmark, avec réserves
BFL a publié des évaluations préliminaires de préférence pour FLUX 3 Video face à sept concurrents sur des clips texte-vers-vidéo de 10 secondes en 720p. FLUX 3 a été préféré à Luma Ray 3.2 dans 93 % des comparaisons, à Runway Gen-4.5 dans 77 %, à Grok Imagine Video dans 69 %, à Kling v3 Pro dans 60 %, à Happy Horse v1 dans 59 %, et à Seedance 2.0 et Google Gemini Omni Flash chacun à 52 %.
BFL précise qu’il s’agit d’une évaluation préliminaire d’un candidat précoce. La méthodologie complète et les tableaux de benchmark seront fournis lors de la disponibilité générale. Les deux comparaisons les plus serrées — 52 % contre Seedance 2.0 (dont le déploiement international est suspendu en raison de litiges sur les droits d’auteur) et Gemini Omni Flash — sont les plus significatives pour les acheteurs d’entreprise occidentaux.
Ce qui manque
Il n’y a pas d’API publique au lancement, ni de tarification. BFL n’a pas publié de poids téléchargeables. FLUX 3 Dev est le dernier de la séquence de déploiement de BFL, arrivant après que Image ait atteint la disponibilité générale. Cette séquence diffère des versions FLUX 1.x, où les poids ouverts sont arrivés en même temps que l’accès commercial et ont favorisé une adoption large par des tiers.
Pourquoi c’est important
FLUX 1.x est devenu le backbone de génération d’images open-weight par défaut pour une grande partie des produits d’IA grand public et développeurs en 2024 et 2025. Un successeur multimodal crédible qui publierait éventuellement des poids ouverts étendrait cette empreinte à la vidéo et à la robotique. Les candidatures pour l’accès anticipé à FLUX 3 Video Early Access sont ouvertes sur bfl.ai. La disponibilité générale de FLUX 3 Image est attendue dans les semaines à venir, comme l’a rapporté en exclusivité VentureBeat.
Originally reported by Black Forest Labs. Read the original article for additional details.
View original source