Black Forest Labs의 차세대 기반 모델. FLUX 3는 이미지·비디오·오디오를 함께 학습해 움직임·소리·구조의 일관성을 높입니다. 네이티브 오디오가 있는 클립(대개 최대 약 20초)을 생성하고 이미지나 비디오에서 이어갈 수 있습니다.
SeedDance에서 사용 가능 — FLUX 3 Video(얼리 액세스)

FLUX 3는 Black Forest Labs가 2026년에 발표한 멀티모달 기반 모델입니다. 주로 이미지에 초점을 둔 이전 FLUX와 달리 Self-Flow 아키텍처로 이미지·비디오·오디오를 공동 학습합니다. 제품면은 FLUX 3 Video, FLUX 3 Image, FLUX 3 Action, 이후 FLUX 3 Dev(오픈 웨이트)로 출시됩니다.
동기화된 대사·효과음·앰비언스가 있는 다양한 클립을 한 번에 생성합니다. 초기 자료는 단일 생성 길이가 대개 최대 약 20초라고 안내합니다(해상도·모드는 제공자 API 기준).
프롬프트로 시작(텍스트 투 비디오), 이미지를 프레임으로 고정(이미지 투 비디오), 또는 기존 클립을 이어(비디오 연속) 캐릭터와 맥락을 유지합니다.
FLUX 3 Image는 복잡한 프롬프트 추종과 화면 내 다국어 텍스트 정확도를 목표로 하며, 비디오 티어 이후 얼리 액세스가 이어집니다.
모달리티 공동 학습으로 충격에 맞는 소리, 구조에 맞는 움직임, 더 일관된 멀티샷을 지향합니다.
FLUX 3는 예쁜 한 프레임 이상이 필요한 크리에이터와 팀을 위한 제품입니다. 오디오가 있는 짧은 내러티브 영상, 참조 기반 연속성, 밀도 높은 프롬프트 이미지 작업.

SeedDance의 FLUX 3 Video 핵심 기능. 옵션은 AI 비디오 생성기와 동일합니다(길이·해상도·초안·오디오·입력).
장면·카메라·스타일·대사를 자연어로 설명해 선택적 네이티브 오디오가 있는 짧은 영상을 생성합니다.
이미지 1장은 픽셀 단위로 오프닝, 2장은 시작·끝, 3~10장은 스토리보드(명시적 길이 필수). 이미지와 시작 비디오는 함께 쓸 수 없습니다.
짧은 mp4(≤15초, ≤50MB)를 start_video로 올려 마지막 프레임에서 이어갑니다. 이미지 입력과 병용 불가.
저비용 고속 720p 초안으로 프롬프트를 반복한 뒤, 정식 품질 720p 또는 1080p를 실행할 수 있습니다.
오디오는 기본 켜짐(앰비언스·말·효과). 끄면 무음 클립이 됩니다.
FLUX 3 Image는 넓은 스타일 범위, 유연한 구도, 더 나은 화면 내 텍스트를 목표로 하며, 비디오 티어 이후 API 얼리 액세스가 진행됩니다.
FLUX 3 및 SeedDance 관련 모델에 대한 자주 묻는 질문.
AI 비디오 생성기를 열고 FLUX 3를 선택한 뒤, 텍스트·이미지 또는 시작 비디오로 선택적 네이티브 오디오 클립을 생성하세요.