FLUX 3 — Multimodale KI für Video, Bild & Audio

Das Next-Gen-Fundamentmodell von Black Forest Labs. FLUX 3 lernt Bild, Video und Audio gemeinsam — für kohärentere Bewegung, Ton und Struktur. Erzeugen Sie Clips mit nativem Audio (häufig bis ca. 20 Sekunden) und setzen Sie aus Bildern oder Video fort, sobald der Video-Tier auf SeeVid live ist.

Demnächst auf SeeVid — FLUX 3 Video

FLUX 3 Videogenerierung Überblick

Multimodales Video von Black Forest Labs

FLUX 3 ist das 2026 angekündigte multimodale Fundamentmodell von Black Forest Labs. Anders als frühere, bildzentrierte FLUX-Versionen wird FLUX 3 gemeinsam auf Bild, Video und Audio in einer Self-Flow-Architektur trainiert — für ein stärkeres gemeinsames Verständnis davon, wie Objekte zusammenhalten, wie sie sich bewegen und wie Ereignisse klingen. Auf SeeVid ist die geplante Produktfläche FLUX 3 Video (Text-, Bild- und Video-Eingaben mit optionalem nativem Audio).

Video + natives Audio

Erzeugen Sie vielfältige Clips mit synchroner Sprache, Effekten und Ambiente in einem Durchgang. Frühe Materialien nennen oft Längen bis ca. 20 Sekunden (Auflösung und Modus je nach Provider-API).

Text-, Bild- und Video-Eingaben

Starten Sie mit einem Prompt (Text-zu-Video), setzen Sie Bilder als Frames (Bild-zu-Video) oder setzen Sie einen Clip fort (Video-Fortsetzung) und tragen Sie Figuren und Kontext weiter.

720p- & 1080p-Ausgabe

Geplante SeeVid-Optionen umfassen 720p und 1080p sowie eine schnelle Draft-Vorschau zum Iterieren von Prompts vor einem Lauf in voller Qualität.

Weltkonsistente Generierung

Gemeinsames Training über Modalitäten hinweg soll Klang zu Impakt passend machen, Bewegung strukturtreu halten und Mehrfach-Shots kohärenter erzählen.

Für kohärente Bewegung, Ton & Stil

FLUX 3 richtet sich an Creator und Teams, die mehr brauchen als ein einzelnes schönes Frame — kurze narrative Videos mit Audio und referenzgesteuerter Kontinuität.

Natives Audio verbindet dialognahe Sprache mit Effekten und Ambiente zu physischen Ereignissen — oft ohne separate Soundtrack-Montage in der Entwurfsphase.

FLUX 3 natives Audio

FLUX 3 Video — Überblick der Fähigkeiten

Geplante Fähigkeiten für FLUX 3 Video auf SeeVid. Die genauen Optionen entsprechen dem KI-Video-Generator, sobald das Modell wiederhergestellt ist (Dauer, Auflösung, Draft, Audio und Eingaben).

Text-zu-Video

Beschreiben Sie Szene, Kamera, Stil und Dialog in natürlicher Sprache und erzeugen Sie ein Kurzvideo mit optionalem nativem Audio.

Bild-zu-Video

Ein Bild öffnet den Clip pixelgenau; zwei setzen Start und Ende; drei bis zehn dienen als Storyboard (explizite Dauer erforderlich). Bilder und Startvideo sind nicht kombinierbar.

Video-Fortsetzung

Laden Sie ein kurzes mp4 (≤15 s, ≤50 MB) als start_video hoch, um von den letzten Frames fortzusetzen. Nicht mit Bildeingaben kombinierbar.

Draft-Vorschau

Erzeugen Sie einen schnellen, günstigeren 720p-Draft zum Prompt-Iterieren, bevor Sie einen vollwertigen 720p- oder 1080p-Lauf starten.

Synchrones Audio

Audio ist standardmäßig an (Ambiente, Sprache, Effekte). Deaktivieren Sie es für einen stummen Clip.

Dauer 5–20 s oder Auto

Wählen Sie eine ganze Sekundenzahl von 5 bis 20 oder auto, damit das Modell die Länge anpasst. Storyboards mit drei oder mehr Bildern benötigen eine explizite Dauer.

Häufig gestellte Fragen

Häufige Fragen zu FLUX 3 und der Verfügbarkeit auf SeeVid.








FLUX 3 Video kommt bald auf SeeVid

Wir bereiten FLUX 3 Video für Text-, Bild- und Startvideo-Workflows mit optionalem nativem Audio vor. Schauen Sie wieder vorbei, wenn der Early Access zurückkehrt.