FLUX 3 — 비디오·이미지·오디오 멀티모달 AI

Black Forest Labs의 차세대 기반 모델. FLUX 3는 이미지·비디오·오디오를 함께 학습해 모션·사운드·구조가 더 일관됩니다. 네이티브 오디오가 있는 클립(보통 최대 약 20초)을 생성하며, SeeVid에 비디오 티어가 열리면 이미지·비디오에서 이어 생성할 수 있습니다.

SeeVid에서 곧 출시 — FLUX 3 Video

FLUX 3 비디오 생성 개요

Black Forest Labs의 멀티모달 비디오

FLUX 3는 Black Forest Labs가 2026년에 발표한 멀티모달 기반 모델입니다. 주로 이미지에 초점을 둔 이전 FLUX와 달리 Self-Flow 아키텍처로 이미지·비디오·오디오를 공동 학습합니다. SeeVid에서 계획 중인 제품면은 FLUX 3 Video(텍스트·이미지·비디오 입력, 선택적 네이티브 오디오)입니다.

비디오 + 네이티브 오디오

한 패스로 다양한 클립과 동기화된 대사·효과·앰비언스를 생성합니다. 공식 초기 자료는 단일 생성 길이를 보통 최대 약 20초로 언급합니다(해상도·모드는 제공자 API에 따름).

텍스트·이미지·비디오 입력

프롬프트로 시작(텍스트 투 비디오), 이미지를 프레임/참조로 고정(이미지 투 비디오), 또는 기존 클립을 이어 생성(비디오 연속)하며 캐릭터와 맥락을 유지합니다.

720p·1080p 출력

SeeVid 예정 옵션에는 720p·1080p와, 본품질 실행 전 프롬프트를 반복하기 위한 빠른 초안 미리보기가 포함됩니다.

세계 일관성 있는 생성

모달리티 공동 학습으로 충격에 맞는 소리, 구조를 따르는 모션, 더 긴 스토리보드에서도 일관된 멀티샷을 목표로 합니다.

일관된 모션·사운드·스타일을 위해

FLUX 3는 한 장의 예쁜 프레임 이상이 필요한 크리에이터와 팀을 위한합니다 — 오디오가 있는 짧은 내러티브 비디오와 참조 기반 연속성.

네이티브 오디오는 립싱크 지향 대사와 물리 이벤트에 묶인 효과·앰비언스를 함께 만들어, 많은 초안에서 별도 사운드트랙 조합을 줄입니다.

FLUX 3 네이티브 오디오

FLUX 3 Video 기능 개요

SeeVid의 FLUX 3 Video 예정 기능입니다. 모델이 복구되면 옵션은 AI 비디오 생성기와 일치합니다(길이, 해상도, 초안, 오디오, 입력).

텍스트 투 비디오

장면·카메라·스타일·대사를 자연어로 설명해 선택적 네이티브 오디오가 있는 짧은 비디오를 생성합니다.

이미지 투 비디오

이미지 1장은 픽셀 단위로 클립을 열고, 2장은 시작·끝, 3–10장은 스토리보드(명시적 길이 필요)입니다. 이미지와 start video는 함께 쓸 수 없습니다.

비디오 연속 생성

짧은 mp4(≤15초, ≤50MB)를 start_video로 올려 마지막 프레임에서 이어 생성합니다. 이미지 입력과 병행할 수 없습니다.

초안 미리보기

저비용 빠른 720p 초안으로 프롬프트를 반복한 뒤 본품질 720p 또는 1080p를 실행합니다.

동기화 오디오

오디오는 기본 켜짐(앰비언스·음성·효과). 무음 클립을 위해 끌 수 있습니다.

길이 5–20초 또는 Auto

5–20초 정수 또는 auto를 선택합니다. 이미지 3장 이상 스토리보드는 명시적 길이가 필요합니다.

자주 묻는 질문

FLUX 3와 SeeVid 가용성에 대한 일반적인 질문입니다.








FLUX 3 Video가 SeeVid에 곧 출시됩니다

텍스트·이미지·start-video 워크플로와 선택적 네이티브 오디오를 위한 FLUX 3 Video를 준비하고 있습니다. 얼리 액세스가 돌아오면 다시 확인해 주세요.