Le modèle de fondation nouvelle génération de Black Forest Labs. FLUX 3 apprend image, vidéo et audio ensemble — pour un mouvement, un son et une structure plus cohérents. Générez des clips avec audio natif (souvent jusqu’à environ 20 secondes) et poursuivez à partir d’images ou de vidéo lorsque le niveau vidéo sera disponible sur SeeVid.
Bientôt sur SeeVid — FLUX 3 Video

FLUX 3 est le modèle de fondation multimodal de Black Forest Labs annoncé en 2026. Contrairement aux versions FLUX surtout centrées sur l’image, FLUX 3 est entraîné conjointement sur image, vidéo et audio dans une architecture Self-Flow — pour une compréhension partagée plus solide de la structure des objets, de leur mouvement et du son des événements. Sur SeeVid, la surface produit prévue est uniquement FLUX 3 Video (entrées texte, image et vidéo avec audio natif optionnel).
Générez des clips variés avec parole, effets et ambiance synchronisés en une passe. Les documents précoces indiquent souvent des durées jusqu’à environ 20 secondes (résolution et mode selon l’API du fournisseur).
Partez d’un prompt (texte-vers-vidéo), ancrez des images comme frames (image-vers-vidéo), ou poursuivez un clip (continuation vidéo) en portant personnages et contexte.
Les options prévues sur SeeVid incluent le 720p et le 1080p, ainsi qu’un aperçu brouillon rapide pour itérer les prompts avant un rendu pleine qualité.
L’entraînement joint entre modalités vise un son qui correspond à l’impact, un mouvement fidèle à la structure, et des séquences multi-plans plus cohérentes.
FLUX 3 s’adresse aux créateurs et équipes qui ont besoin de plus qu’une belle image — courte vidéo narrative avec audio et continuité guidée par références.

Capacités prévues pour FLUX 3 Video sur SeeVid. Les options exactes correspondront au générateur vidéo IA lorsque le modèle sera rétabli (durée, résolution, brouillon, audio et entrées).
Décrivez scène, caméra, style et dialogue en langage naturel pour générer une courte vidéo avec audio natif optionnel.
Une image ouvre le clip pixel pour pixel ; deux fixent début et fin ; trois à dix forment un storyboard (durée explicite requise). Images et vidéo de départ ne se combinent pas.
Importez un mp4 court (≤15 s, ≤50 Mo) comme start_video pour poursuivre depuis les dernières frames. Non combinable avec des entrées image.
Générez un brouillon 720p rapide et moins coûteux pour itérer le prompt avant un rendu 720p ou 1080p complet.
L’audio est activé par défaut (ambiance, parole, effets). Désactivez-le pour un clip silencieux.
Choisissez un nombre entier de secondes de 5 à 20, ou auto pour que le modèle ajuste le contenu. Les storyboards avec trois images ou plus nécessitent une durée explicite.
Questions courantes sur FLUX 3 et la disponibilité sur SeeVid.
Nous préparons FLUX 3 Video pour les workflows texte, image et vidéo de départ avec audio natif optionnel. Revenez lorsque l’accès anticipé sera rétabli.