Black Forest Labs의 차세대 기반 모델. FLUX 3는 이미지·비디오·오디오를 함께 학습해 모션·사운드·구조가 더 일관됩니다. 네이티브 오디오가 있는 클립(보통 최대 약 20초)을 생성하며, SeeVid에 비디오 티어가 열리면 이미지·비디오에서 이어 생성할 수 있습니다.
SeeVid에서 곧 출시 — FLUX 3 Video

FLUX 3는 Black Forest Labs가 2026년에 발표한 멀티모달 기반 모델입니다. 주로 이미지에 초점을 둔 이전 FLUX와 달리 Self-Flow 아키텍처로 이미지·비디오·오디오를 공동 학습합니다. SeeVid에서 계획 중인 제품면은 FLUX 3 Video(텍스트·이미지·비디오 입력, 선택적 네이티브 오디오)입니다.
한 패스로 다양한 클립과 동기화된 대사·효과·앰비언스를 생성합니다. 공식 초기 자료는 단일 생성 길이를 보통 최대 약 20초로 언급합니다(해상도·모드는 제공자 API에 따름).
프롬프트로 시작(텍스트 투 비디오), 이미지를 프레임/참조로 고정(이미지 투 비디오), 또는 기존 클립을 이어 생성(비디오 연속)하며 캐릭터와 맥락을 유지합니다.
SeeVid 예정 옵션에는 720p·1080p와, 본품질 실행 전 프롬프트를 반복하기 위한 빠른 초안 미리보기가 포함됩니다.
모달리티 공동 학습으로 충격에 맞는 소리, 구조를 따르는 모션, 더 긴 스토리보드에서도 일관된 멀티샷을 목표로 합니다.
FLUX 3는 한 장의 예쁜 프레임 이상이 필요한 크리에이터와 팀을 위한합니다 — 오디오가 있는 짧은 내러티브 비디오와 참조 기반 연속성.

SeeVid의 FLUX 3 Video 예정 기능입니다. 모델이 복구되면 옵션은 AI 비디오 생성기와 일치합니다(길이, 해상도, 초안, 오디오, 입력).
장면·카메라·스타일·대사를 자연어로 설명해 선택적 네이티브 오디오가 있는 짧은 비디오를 생성합니다.
이미지 1장은 픽셀 단위로 클립을 열고, 2장은 시작·끝, 3–10장은 스토리보드(명시적 길이 필요)입니다. 이미지와 start video는 함께 쓸 수 없습니다.
짧은 mp4(≤15초, ≤50MB)를 start_video로 올려 마지막 프레임에서 이어 생성합니다. 이미지 입력과 병행할 수 없습니다.
저비용 빠른 720p 초안으로 프롬프트를 반복한 뒤 본품질 720p 또는 1080p를 실행합니다.
오디오는 기본 켜짐(앰비언스·음성·효과). 무음 클립을 위해 끌 수 있습니다.
5–20초 정수 또는 auto를 선택합니다. 이미지 3장 이상 스토리보드는 명시적 길이가 필요합니다.
FLUX 3와 SeeVid 가용성에 대한 일반적인 질문입니다.
텍스트·이미지·start-video 워크플로와 선택적 네이티브 오디오를 위한 FLUX 3 Video를 준비하고 있습니다. 얼리 액세스가 돌아오면 다시 확인해 주세요.