FLUX 3 — IA multimodale pour vidéo, image et audioMultimodal

Le modèle de fondation nouvelle génération de Black Forest Labs. FLUX 3 apprend image, vidéo et audio ensemble — pour un mouvement, un son et une structure plus cohérents. Générez des clips avec audio natif (souvent jusqu’à environ 20 secondes), poursuivez à partir d’images ou de vidéo, et préparez une synthèse d’image plus forte.

Disponible sur SeedDance — FLUX 3 Video (accès anticipé)

Aperçu multimodal FLUX 3

Un backbone pour l’intelligence visuelle

FLUX 3 est le modèle de fondation multimodal de Black Forest Labs annoncé en 2026. Contrairement aux versions FLUX surtout centrées sur l’image, FLUX 3 est entraîné conjointement sur image, vidéo et audio dans une architecture Self-Flow. Les surfaces produit se déploient en FLUX 3 Video, FLUX 3 Image, FLUX 3 Action, puis FLUX 3 Dev (poids ouverts).

Vidéo + audio natif

Générez des clips variés avec parole, effets et ambiance synchronisés en une passe. Les documents précoces indiquent souvent des durées jusqu’à environ 20 secondes (résolution et mode selon l’API du fournisseur).

Entrées texte, image et vidéo

Partez d’un prompt (texte-vers-vidéo), ancrez des images comme frames (image-vers-vidéo), ou poursuivez un clip (continuation vidéo) en portant personnages et contexte.

Synthèse d’image renforcée

FLUX 3 Image vise un meilleur suivi des prompts complexes et un texte multilingue précis à l’écran — avec un accès anticipé après le niveau vidéo.

Génération cohérente avec le monde

L’entraînement joint entre modalités vise un son qui correspond à l’impact, un mouvement fidèle à la structure, et des séquences multi-plans plus cohérentes.

Conçu pour un mouvement, un son et un style cohérents

FLUX 3 s’adresse aux créateurs et équipes qui ont besoin de plus qu’une belle image — courte vidéo narrative avec audio, continuité guidée par références, et travail image sur prompts denses.

L’audio natif associe dialogue, effets et ambiance liés aux événements physiques — réduisant le besoin d’assembler une bande-son séparée pour de nombreux brouillons.

Audio natif FLUX 3

Aperçu des capacités FLUX 3

Capacités principales de FLUX 3 Video sur SeedDance. Les options correspondent au générateur vidéo IA (durée, résolution, brouillon, audio et entrées).

Texte vers vidéo

Décrivez scène, caméra, style et dialogue en langage naturel pour générer une courte vidéo avec audio natif optionnel.

Image vers vidéo

Une image ouvre le clip pixel pour pixel ; deux fixent début et fin ; trois à dix forment un storyboard (durée explicite requise). Images et vidéo de départ ne se combinent pas.

Continuation vidéo

Importez un mp4 court (≤15 s, ≤50 Mo) comme start_video pour poursuivre depuis les dernières frames. Non combinable avec des entrées image.

Aperçu brouillon

Générez un brouillon 720p rapide et moins coûteux pour itérer le prompt avant un rendu 720p ou 1080p complet.

Audio synchronisé

L’audio est activé par défaut (ambiance, parole, effets). Désactivez-le pour un clip silencieux.

Synthèse et édition d’image

FLUX 3 Image vise une large gamme de styles, des cadrages flexibles et un meilleur texte dans l’image — accès anticipé API après le niveau vidéo.

Questions fréquentes

Questions courantes sur FLUX 3 et les modèles associés sur SeedDance.








Créez avec FLUX 3 Video sur SeedDance

Ouvrez le générateur vidéo IA, sélectionnez FLUX 3 et générez des clips avec audio natif optionnel — à partir de texte, d’images ou d’une vidéo de départ.