Black Forest Labs 新一代基础模型。FLUX 3 联合学习图像、视频与音频,让运动、声音与结构更一致。可生成带原生音频的短片(常见约最长 20 秒),从图或视频续写,并为更强的复杂提示与多语言文字图像合成做准备。
已在 SeedDance 可用 — FLUX 3 Video(early access)

FLUX 3 是 Black Forest Labs 于 2026 年发布的多模态基础模型。与主要面向图像的早期 FLUX 不同,FLUX 3 基于 Self-Flow 统一架构,同时在图像、视频与音频上训练,更强调物体如何成立、如何运动、事件如何发声。产品面将以 FLUX 3 Video、FLUX 3 Image、FLUX 3 Action,以及后续的 FLUX 3 Dev(开源权重)等形式逐步开放。
一次生成多样风格短片,并同步对白、效果与环境声。官方早期材料提到单次生成时长常见约最长 20 秒(分辨率与模式以服务商 API 为准)。
可从提示词出发(文生视频),用图片作为起始帧或参考(图生视频),或续写已有片段(视频续写),并尽量保持角色与语境连贯。
FLUX 3 Image 侧重更复杂的提示遵循与画面内多语言文字准确渲染,支持多样风格、画幅与分辨率;早期访问在视频能力之后陆续开放。
跨模态联合训练,使声音与碰撞匹配、运动更符合结构,多镜头序列在更长叙事草稿中更连贯。
FLUX 3 面向需要的不止单帧好看的创作者与团队:带音频的短叙事视频、参考驱动的连续性,以及能跟上密集提示的图像工作流。

SeedDance 上 FLUX 3 Video 的核心能力。具体选项与 AI 视频生成器一致(时长、分辨率、草稿、音频与输入方式)。
用自然语言描述场景、运镜、风格与对白,生成带可选原生音频的短视频。
1 张图作为开场首帧(像素级);2 张为起止帧;3–10 张为分镜(须指定明确时长)。图片与续写视频不可同时使用。
上传短 mp4(≤15 秒、≤50MB)作为 start_video,从末帧续写。不可与图片输入同时使用。
可先生成低成本 720p 草稿迭代提示词,再跑完整质量的 720p 或 1080p。
默认开启同步音频(环境声、对白、效果);可关闭以生成无声片段。
FLUX 3 Image 面向更广风格、灵活画幅与更好的画面内文字;API 早期访问在视频层级之后推进。
关于 FLUX 3 以及在 SeedDance 使用相关模型的常见问题。