Black Forest Labs 新一代基础模型。FLUX 3 联合学习图像、视频与音频,让运动、声音与结构更一致。可生成带原生音频的短片(常见约最长 20 秒);待 SeeVid 上线视频能力后,还可从图或视频续写。
即将上线 — FLUX 3 Video

FLUX 3 是 Black Forest Labs 于 2026 年发布的多模态基础模型。与主要面向图像的早期 FLUX 不同,FLUX 3 基于 Self-Flow 统一架构,同时在图像、视频与音频上训练,更强调物体如何成立、如何运动、事件如何发声。在 SeeVid 上,计划开放的产品面是 FLUX 3 Video(文本、图像与视频输入,可选原生音频)。
一次生成多样风格短片,并同步对白、效果与环境声。官方早期材料提到单次生成时长常见约最长 20 秒(分辨率与模式以服务商 API 为准)。
可从提示词出发(文生视频),用图片作为起始帧或参考(图生视频),或续写已有片段(视频续写),并尽量保持角色与语境连贯。
SeeVid 计划提供 720p 与 1080p,以及快速草稿预览,便于在完整质量生成前迭代提示词。
跨模态联合训练,使声音与碰撞匹配、运动更符合结构,多镜头序列在更长叙事草稿中更连贯。
FLUX 3 面向需要的不止单帧好看的创作者与团队:带音频的短叙事视频,以及参考驱动的连续性。

SeeVid 上 FLUX 3 Video 的计划能力。模型恢复后,具体选项将与 AI 视频生成器一致(时长、分辨率、草稿、音频与输入方式)。
用自然语言描述场景、运镜、风格与对白,生成带可选原生音频的短视频。
1 张图作为开场首帧(像素级);2 张为起止帧;3–10 张为分镜(须指定明确时长)。图片与续写视频不可同时使用。
上传短 mp4(≤15 秒、≤50MB)作为 start_video,从末帧续写。不可与图片输入同时使用。
可先生成低成本 720p 草稿迭代提示词,再跑完整质量的 720p 或 1080p。
默认开启同步音频(环境声、对白、效果);可关闭以生成无声片段。
可选 5 至 20 的整秒,或 auto 由模型适配内容。三张及以上分镜图须指定明确时长。
关于 FLUX 3 以及 SeeVid 可用性的常见问题。