FLUX 3 — 비디오·이미지·오디오 멀티모달 AI

Black Forest Labs의 차세대 기반 모델. FLUX 3는 이미지·비디오·오디오를 함께 학습해 움직임·소리·구조의 일관성을 높입니다. 네이티브 오디오가 있는 클립(대개 최대 약 20초)을 생성하고 이미지나 비디오에서 이어갈 수 있습니다.

SeedDance에서 사용 가능 — FLUX 3 Video(얼리 액세스)

FLUX 3 멀티모달 개요

시각 지능을 위한 하나의 백본

FLUX 3는 Black Forest Labs가 2026년에 발표한 멀티모달 기반 모델입니다. 주로 이미지에 초점을 둔 이전 FLUX와 달리 Self-Flow 아키텍처로 이미지·비디오·오디오를 공동 학습합니다. 제품면은 FLUX 3 Video, FLUX 3 Image, FLUX 3 Action, 이후 FLUX 3 Dev(오픈 웨이트)로 출시됩니다.

비디오 + 네이티브 오디오

동기화된 대사·효과음·앰비언스가 있는 다양한 클립을 한 번에 생성합니다. 초기 자료는 단일 생성 길이가 대개 최대 약 20초라고 안내합니다(해상도·모드는 제공자 API 기준).

텍스트·이미지·비디오 입력

프롬프트로 시작(텍스트 투 비디오), 이미지를 프레임으로 고정(이미지 투 비디오), 또는 기존 클립을 이어(비디오 연속) 캐릭터와 맥락을 유지합니다.

더 강한 이미지 합성

FLUX 3 Image는 복잡한 프롬프트 추종과 화면 내 다국어 텍스트 정확도를 목표로 하며, 비디오 티어 이후 얼리 액세스가 이어집니다.

세계 일관성 있는 생성

모달리티 공동 학습으로 충격에 맞는 소리, 구조에 맞는 움직임, 더 일관된 멀티샷을 지향합니다.

일관된 움직임·소리·스타일을 위해

FLUX 3는 예쁜 한 프레임 이상이 필요한 크리에이터와 팀을 위한 제품입니다. 오디오가 있는 짧은 내러티브 영상, 참조 기반 연속성, 밀도 높은 프롬프트 이미지 작업.

네이티브 오디오는 대화와 물리 이벤트에 맞는 효과·앰비언스를 함께 생성해, 많은 초안 단계에서 별도 사운드트랙을 맞출 필요를 줄입니다.

FLUX 3 네이티브 오디오

FLUX 3 기능 개요

SeedDance의 FLUX 3 Video 핵심 기능. 옵션은 AI 비디오 생성기와 동일합니다(길이·해상도·초안·오디오·입력).

텍스트 투 비디오

장면·카메라·스타일·대사를 자연어로 설명해 선택적 네이티브 오디오가 있는 짧은 영상을 생성합니다.

이미지 투 비디오

이미지 1장은 픽셀 단위로 오프닝, 2장은 시작·끝, 3~10장은 스토리보드(명시적 길이 필수). 이미지와 시작 비디오는 함께 쓸 수 없습니다.

비디오 연속

짧은 mp4(≤15초, ≤50MB)를 start_video로 올려 마지막 프레임에서 이어갑니다. 이미지 입력과 병용 불가.

초안 미리보기

저비용 고속 720p 초안으로 프롬프트를 반복한 뒤, 정식 품질 720p 또는 1080p를 실행할 수 있습니다.

동기화 오디오

오디오는 기본 켜짐(앰비언스·말·효과). 끄면 무음 클립이 됩니다.

이미지 합성 및 편집

FLUX 3 Image는 넓은 스타일 범위, 유연한 구도, 더 나은 화면 내 텍스트를 목표로 하며, 비디오 티어 이후 API 얼리 액세스가 진행됩니다.

자주 묻는 질문

FLUX 3 및 SeedDance 관련 모델에 대한 자주 묻는 질문.








SeedDance에서 FLUX 3 Video로 만들기

AI 비디오 생성기를 열고 FLUX 3를 선택한 뒤, 텍스트·이미지 또는 시작 비디오로 선택적 네이티브 오디오 클립을 생성하세요.