FLUX 3 — 動画・画像・音声のマルチモーダル AI

Black Forest Labs の次世代基盤モデル。FLUX 3 は画像・動画・音声を一緒に学習し、動き・音・構造の一貫性を高めます。ネイティブ音声付きクリップ(多くの場合最大約20秒)を生成し、画像や動画から継続できます。

SeedDance で利用可能 — FLUX 3 Video(早期アクセス)

FLUX 3 マルチモーダル概要

視覚知能のための一本のバックボーン

FLUX 3 は Black Forest Labs が 2026 年に発表したマルチモーダル基盤モデルです。主に画像向けだった従来の FLUX と異なり、Self-Flow アーキテクチャで画像・動画・音声を共同学習します。製品面は FLUX 3 Video、FLUX 3 Image、FLUX 3 Action、将来の FLUX 3 Dev(オープンウェイト)として展開されます。

動画 + ネイティブ音声

同期した発話・効果音・環境音付きの多様なクリップを一度に生成。初期資料では単回生成が最大約20秒(解像度・モードはプロバイダー API 準拠)とされています。

テキスト・画像・動画入力

プロンプトから開始(テキストから動画)、画像をフレームとして固定(画像から動画)、または既存クリップを継続(動画継続)し、キャラクターと文脈を引き継ぎます。

より強い画像合成

FLUX 3 Image は複雑なプロンプト追従と画面内の多言語テキスト精度を重視。動画ティアの後に早期アクセスが展開されます。

世界一貫性のある生成

モーダリティ横断の共同学習により、衝撃に合う音、構造に沿った動き、より一貫したマルチショットを目指します。

一貫した動き・音・スタイルのために

FLUX 3 は、美しい1フレーム以上を必要とするクリエイター向けです。音声付き短編ナラティブ、参照駆動の連続性、密なプロンプトに追従する画像ワークフロー。

ネイティブ音声は対話と物理イベントに紐づく効果・環境音を一緒に生成し、多くの下書き段階で別途サウンドトラックを組む手間を減らします。

FLUX 3 ネイティブ音声

FLUX 3 機能概要

SeedDance 上の FLUX 3 Video の主要機能。オプションは AI 動画ジェネレーターと一致します(尺・解像度・下書き・音声・入力)。

テキストから動画

シーン・カメラ・スタイル・台詞を自然言語で記述し、任意のネイティブ音声付き短尺動画を生成します。

画像から動画

1枚は開幕フレーム(ピクセル一致)、2枚は起止、3〜10枚はストーリーボード(明示的な尺が必須)。画像と開始動画は併用不可。

動画継続

短い mp4(≤15秒、≤50MB)を start_video としてアップロードし、最終フレームから継続。画像入力とは併用不可。

下書きプレビュー

低コストの高速 720p 下書きでプロンプトを反復してから、本品質の 720p / 1080p を実行できます。

同期音声

音声はデフォルトでオン(環境音・発話・効果)。オフにすると無音クリップになります。

画像合成と編集

FLUX 3 Image は幅広いスタイル、柔軟な画角、より良い画面内テキストを目指し、動画ティアの後に API 早期アクセスが進みます。

よくある質問

FLUX 3 と SeedDance 上の関連モデルについてのよくある質問。








SeedDance で FLUX 3 Video を作成

AI 動画ジェネレーターを開き、FLUX 3 を選んで、テキスト・画像・開始動画から任意のネイティブ音声付きクリップを生成しましょう。