Black Forest Labs の次世代基盤モデル。FLUX 3 は画像・動画・音声を一緒に学習し、動き・音・構造の一貫性を高めます。ネイティブ音声付きクリップ(多くの場合最大約20秒)を生成し、画像や動画から継続できます。
SeedDance で利用可能 — FLUX 3 Video(早期アクセス)

FLUX 3 は Black Forest Labs が 2026 年に発表したマルチモーダル基盤モデルです。主に画像向けだった従来の FLUX と異なり、Self-Flow アーキテクチャで画像・動画・音声を共同学習します。製品面は FLUX 3 Video、FLUX 3 Image、FLUX 3 Action、将来の FLUX 3 Dev(オープンウェイト)として展開されます。
同期した発話・効果音・環境音付きの多様なクリップを一度に生成。初期資料では単回生成が最大約20秒(解像度・モードはプロバイダー API 準拠)とされています。
プロンプトから開始(テキストから動画)、画像をフレームとして固定(画像から動画)、または既存クリップを継続(動画継続)し、キャラクターと文脈を引き継ぎます。
FLUX 3 Image は複雑なプロンプト追従と画面内の多言語テキスト精度を重視。動画ティアの後に早期アクセスが展開されます。
モーダリティ横断の共同学習により、衝撃に合う音、構造に沿った動き、より一貫したマルチショットを目指します。
FLUX 3 は、美しい1フレーム以上を必要とするクリエイター向けです。音声付き短編ナラティブ、参照駆動の連続性、密なプロンプトに追従する画像ワークフロー。

SeedDance 上の FLUX 3 Video の主要機能。オプションは AI 動画ジェネレーターと一致します(尺・解像度・下書き・音声・入力)。
シーン・カメラ・スタイル・台詞を自然言語で記述し、任意のネイティブ音声付き短尺動画を生成します。
1枚は開幕フレーム(ピクセル一致)、2枚は起止、3〜10枚はストーリーボード(明示的な尺が必須)。画像と開始動画は併用不可。
短い mp4(≤15秒、≤50MB)を start_video としてアップロードし、最終フレームから継続。画像入力とは併用不可。
低コストの高速 720p 下書きでプロンプトを反復してから、本品質の 720p / 1080p を実行できます。
音声はデフォルトでオン(環境音・発話・効果)。オフにすると無音クリップになります。
FLUX 3 Image は幅広いスタイル、柔軟な画角、より良い画面内テキストを目指し、動画ティアの後に API 早期アクセスが進みます。
FLUX 3 と SeedDance 上の関連モデルについてのよくある質問。
AI 動画ジェネレーターを開き、FLUX 3 を選んで、テキスト・画像・開始動画から任意のネイティブ音声付きクリップを生成しましょう。