FLUX 3 — 视频、图像与音频一体的多模态 AI

Black Forest Labs 新一代基础模型。FLUX 3 联合学习图像、视频与音频,让运动、声音与结构更一致。可生成带原生音频的短片(常见约最长 20 秒);待 SeeVid 上线视频能力后,还可从图或视频续写。

即将上线 — FLUX 3 Video

FLUX 3 视频生成概览

来自 Black Forest Labs 的多模态视频

FLUX 3 是 Black Forest Labs 于 2026 年发布的多模态基础模型。与主要面向图像的早期 FLUX 不同,FLUX 3 基于 Self-Flow 统一架构,同时在图像、视频与音频上训练,更强调物体如何成立、如何运动、事件如何发声。在 SeeVid 上,计划开放的产品面是 FLUX 3 Video(文本、图像与视频输入,可选原生音频)。

视频 + 原生音频

一次生成多样风格短片,并同步对白、效果与环境声。官方早期材料提到单次生成时长常见约最长 20 秒(分辨率与模式以服务商 API 为准)。

文本、图像与视频输入

可从提示词出发(文生视频),用图片作为起始帧或参考(图生视频),或续写已有片段(视频续写),并尽量保持角色与语境连贯。

720p 与 1080p 输出

SeeVid 计划提供 720p 与 1080p,以及快速草稿预览,便于在完整质量生成前迭代提示词。

更一致的世界感生成

跨模态联合训练,使声音与碰撞匹配、运动更符合结构,多镜头序列在更长叙事草稿中更连贯。

为连贯运动、声音与风格而生

FLUX 3 面向需要的不止单帧好看的创作者与团队:带音频的短叙事视频,以及参考驱动的连续性。

原生音频可将偏口型同步的对白与物理事件相关的效果、环境声一并生成,减少很多草稿阶段的后期配音拼接。

FLUX 3 原生音频

FLUX 3 Video 能力概览

SeeVid 上 FLUX 3 Video 的计划能力。模型恢复后,具体选项将与 AI 视频生成器一致(时长、分辨率、草稿、音频与输入方式)。

文生视频

用自然语言描述场景、运镜、风格与对白,生成带可选原生音频的短视频。

图生视频

1 张图作为开场首帧(像素级);2 张为起止帧;3–10 张为分镜(须指定明确时长)。图片与续写视频不可同时使用。

视频续写

上传短 mp4(≤15 秒、≤50MB)作为 start_video,从末帧续写。不可与图片输入同时使用。

草稿预览

可先生成低成本 720p 草稿迭代提示词,再跑完整质量的 720p 或 1080p。

同步音频

默认开启同步音频(环境声、对白、效果);可关闭以生成无声片段。

时长 5–20 秒或 Auto

可选 5 至 20 的整秒,或 auto 由模型适配内容。三张及以上分镜图须指定明确时长。

常见问题

关于 FLUX 3 以及 SeeVid 可用性的常见问题。








FLUX 3 Video 即将在 SeeVid 上线

我们正在准备支持文本、图像与续写视频、可选原生音频的 FLUX 3 Video。早期访问恢复后请再回来查看。