FLUX 3 — IA multimodale pour vidéo, image et audioMultimodal

Le modèle de fondation nouvelle génération de Black Forest Labs. FLUX 3 apprend image, vidéo et audio ensemble — pour un mouvement, un son et une structure plus cohérents. Générez des clips avec audio natif (souvent jusqu’à environ 20 secondes) et poursuivez à partir d’images ou de vidéo lorsque le niveau vidéo sera disponible sur SeeVid.

Bientôt sur SeeVid — FLUX 3 Video

Aperçu de la génération vidéo FLUX 3

Vidéo multimodale de Black Forest Labs

FLUX 3 est le modèle de fondation multimodal de Black Forest Labs annoncé en 2026. Contrairement aux versions FLUX surtout centrées sur l’image, FLUX 3 est entraîné conjointement sur image, vidéo et audio dans une architecture Self-Flow — pour une compréhension partagée plus solide de la structure des objets, de leur mouvement et du son des événements. Sur SeeVid, la surface produit prévue est uniquement FLUX 3 Video (entrées texte, image et vidéo avec audio natif optionnel).

Vidéo + audio natif

Générez des clips variés avec parole, effets et ambiance synchronisés en une passe. Les documents précoces indiquent souvent des durées jusqu’à environ 20 secondes (résolution et mode selon l’API du fournisseur).

Entrées texte, image et vidéo

Partez d’un prompt (texte-vers-vidéo), ancrez des images comme frames (image-vers-vidéo), ou poursuivez un clip (continuation vidéo) en portant personnages et contexte.

Sortie 720p et 1080p

Les options prévues sur SeeVid incluent le 720p et le 1080p, ainsi qu’un aperçu brouillon rapide pour itérer les prompts avant un rendu pleine qualité.

Génération cohérente avec le monde

L’entraînement joint entre modalités vise un son qui correspond à l’impact, un mouvement fidèle à la structure, et des séquences multi-plans plus cohérentes.

Conçu pour un mouvement, un son et un style cohérents

FLUX 3 s’adresse aux créateurs et équipes qui ont besoin de plus qu’une belle image — courte vidéo narrative avec audio et continuité guidée par références.

L’audio natif associe dialogue, effets et ambiance liés aux événements physiques — réduisant le besoin d’assembler une bande-son séparée pour de nombreux brouillons.

Audio natif FLUX 3

Aperçu des capacités FLUX 3 Video

Capacités prévues pour FLUX 3 Video sur SeeVid. Les options exactes correspondront au générateur vidéo IA lorsque le modèle sera rétabli (durée, résolution, brouillon, audio et entrées).

Texte vers vidéo

Décrivez scène, caméra, style et dialogue en langage naturel pour générer une courte vidéo avec audio natif optionnel.

Image vers vidéo

Une image ouvre le clip pixel pour pixel ; deux fixent début et fin ; trois à dix forment un storyboard (durée explicite requise). Images et vidéo de départ ne se combinent pas.

Continuation vidéo

Importez un mp4 court (≤15 s, ≤50 Mo) comme start_video pour poursuivre depuis les dernières frames. Non combinable avec des entrées image.

Aperçu brouillon

Générez un brouillon 720p rapide et moins coûteux pour itérer le prompt avant un rendu 720p ou 1080p complet.

Audio synchronisé

L’audio est activé par défaut (ambiance, parole, effets). Désactivez-le pour un clip silencieux.

Durée 5–20 s ou Auto

Choisissez un nombre entier de secondes de 5 à 20, ou auto pour que le modèle ajuste le contenu. Les storyboards avec trois images ou plus nécessitent une durée explicite.

Questions fréquentes

Questions courantes sur FLUX 3 et la disponibilité sur SeeVid.








FLUX 3 Video arrive bientôt sur SeeVid

Nous préparons FLUX 3 Video pour les workflows texte, image et vidéo de départ avec audio natif optionnel. Revenez lorsque l’accès anticipé sera rétabli.