FLUX 3 — Multimodale KI für Video, Bild & Audio

Das Next-Gen-Fundamentmodell von Black Forest Labs. FLUX 3 lernt Bild, Video und Audio gemeinsam — für kohärentere Bewegung, Ton und Struktur. Erzeugen Sie Clips mit nativem Audio (häufig bis ca. 20 Sekunden), setzen Sie aus Bildern oder Video fort und bereiten Sie stärkere Bildsynthese vor.

Auf SeedDance verfügbar — FLUX 3 Video (Early Access)

FLUX 3 multimodaler Überblick

Ein Backbone für visuelle Intelligenz

FLUX 3 ist das 2026 angekündigte multimodale Fundamentmodell von Black Forest Labs. Anders als frühere, bildzentrierte FLUX-Versionen wird FLUX 3 gemeinsam auf Bild, Video und Audio in einer Self-Flow-Architektur trainiert. Produktflächen rollen als FLUX 3 Video, FLUX 3 Image, FLUX 3 Action und später FLUX 3 Dev (Open Weights) aus.

Video + natives Audio

Erzeugen Sie vielfältige Clips mit synchroner Sprache, Effekten und Ambiente in einem Durchgang. Frühe Materialien nennen oft Längen bis ca. 20 Sekunden (Auflösung und Modus je nach Provider-API).

Text-, Bild- und Video-Eingaben

Starten Sie mit einem Prompt (Text-zu-Video), setzen Sie Bilder als Frames (Bild-zu-Video) oder setzen Sie einen Clip fort (Video-Fortsetzung) und tragen Sie Figuren und Kontext weiter.

Stärkere Bildsynthese

FLUX 3 Image zielt auf bessere komplexe Prompts und mehrsprachigen Text im Bild — mit Early Access nach dem Video-Tier.

Weltkonsistente Generierung

Gemeinsames Training über Modalitäten hinweg soll Klang zu Impakt passend machen, Bewegung strukturtreu halten und Mehrfach-Shots kohärenter erzählen.

Für kohärente Bewegung, Ton & Stil

FLUX 3 richtet sich an Creator und Teams, die mehr brauchen als ein einzelnes schönes Frame — kurze narrative Videos mit Audio, referenzgesteuerte Kontinuität und Bildarbeit für dichte Prompts.

Natives Audio verbindet dialognahe Sprache mit Effekten und Ambiente zu physischen Ereignissen — oft ohne separate Soundtrack-Montage in der Entwurfsphase.

FLUX 3 natives Audio

FLUX 3 — Überblick der Fähigkeiten

Kernfähigkeiten von FLUX 3 Video auf SeedDance. Optionen entsprechen dem KI-Video-Generator (Dauer, Auflösung, Draft, Audio und Eingaben).

Text-zu-Video

Beschreiben Sie Szene, Kamera, Stil und Dialog in natürlicher Sprache und erzeugen Sie ein Kurzvideo mit optionalem nativem Audio.

Bild-zu-Video

Ein Bild öffnet den Clip pixelgenau; zwei setzen Start und Ende; drei bis zehn dienen als Storyboard (explizite Dauer erforderlich). Bilder und Startvideo sind nicht kombinierbar.

Video-Fortsetzung

Laden Sie ein kurzes mp4 (≤15 s, ≤50 MB) als start_video hoch, um von den letzten Frames fortzusetzen. Nicht mit Bildeingaben kombinierbar.

Draft-Vorschau

Erzeugen Sie einen schnellen, günstigeren 720p-Draft zum Prompt-Iterieren, bevor Sie einen vollwertigen 720p- oder 1080p-Lauf starten.

Synchrones Audio

Audio ist standardmäßig an (Ambiente, Sprache, Effekte). Deaktivieren Sie es für einen stummen Clip.

Bildsynthese & Bearbeitung

FLUX 3 Image zielt auf breite Stilvielfalt, flexible Formate und besseren Text im Bild — API-Early-Access nach dem Video-Tier.

Häufig gestellte Fragen

Häufige Fragen zu FLUX 3 und verwandten Modellen auf SeedDance.








Mit FLUX 3 Video auf SeedDance erstellen

Öffnen Sie den KI-Video-Generator, wählen Sie FLUX 3 und erzeugen Sie Clips mit optionalem nativem Audio — aus Text, Bildern oder einem Startvideo.