FLUX 3 — 動画・画像・音声のマルチモーダル AI

Black Forest Labs の次世代基盤モデル。FLUX 3 は画像・動画・音声を一緒に学習し、動き・音・構造の一貫性を高めます。ネイティブ音声付きクリップ(多くの場合最大約20秒)を生成し、動画ティアが SeeVid で公開されたら画像や動画から継続できます。

SeeVid で近日公開 — FLUX 3 Video

FLUX 3 動画生成の概要

Black Forest Labs のマルチモーダル動画

FLUX 3 は Black Forest Labs が 2026 年に発表したマルチモーダル基盤モデルです。主に画像向けだった従来の FLUX と異なり、Self-Flow アーキテクチャで画像・動画・音声を共同学習し、物体の成り立ち・動き・出来事の音の共有理解を強化します。SeeVid で予定している製品面は FLUX 3 Video のみ(テキスト・画像・動画入力と任意のネイティブ音声)です。

動画 + ネイティブ音声

同期した発話・効果音・環境音付きの多様なクリップを一度に生成。初期資料では単回生成が最大約20秒(解像度・モードはプロバイダー API 準拠)とされています。

テキスト・画像・動画入力

プロンプトから開始(テキストから動画)、画像をフレームとして固定(画像から動画)、または既存クリップを継続(動画継続)し、キャラクターと文脈を引き継ぎます。

720p・1080p 出力

SeeVid で予定しているオプションには 720p と 1080p、および本品質実行前にプロンプトを反復するための高速下書きプレビューがあります。

世界一貫性のある生成

モーダリティ横断の共同学習により、衝撃に合う音、構造に沿った動き、より一貫したマルチショットを目指します。

一貫した動き・音・スタイルのために

FLUX 3 は、美しい1フレーム以上を必要とするクリエイター向けです。音声付き短編ナラティブと参照駆動の連続性。

ネイティブ音声は対話と物理イベントに紐づく効果・環境音を一緒に生成し、多くの下書き段階で別途サウンドトラックを組む手間を減らします。

FLUX 3 ネイティブ音声

FLUX 3 Video 機能概要

SeeVid 上の FLUX 3 Video の予定機能。モデルが復旧した際、オプションは AI 動画ジェネレーターと一致します(尺・解像度・下書き・音声・入力)。

テキストから動画

シーン・カメラ・スタイル・台詞を自然言語で記述し、任意のネイティブ音声付き短尺動画を生成します。

画像から動画

1枚は開幕フレーム(ピクセル一致)、2枚は起止、3〜10枚はストーリーボード(明示的な尺が必須)。画像と開始動画は併用不可。

動画継続

短い mp4(≤15秒、≤50MB)を start_video としてアップロードし、最終フレームから継続。画像入力とは併用不可。

下書きプレビュー

低コストの高速 720p 下書きでプロンプトを反復してから、本品質の 720p / 1080p を実行できます。

同期音声

音声はデフォルトでオン(環境音・発話・効果)。オフにすると無音クリップになります。

尺 5〜20秒または Auto

5〜20 の整数秒を選ぶか、auto でモデルに内容に合わせて調整させます。画像が3枚以上のストーリーボードは明示的な尺が必要です。

よくある質問

FLUX 3 と SeeVid での提供状況についてのよくある質問。








FLUX 3 Video は SeeVid で近日公開

テキスト・画像・開始動画のワークフローと任意のネイティブ音声向けに FLUX 3 Video を準備中です。早期アクセスが戻ったらまたご確認ください。