FLUX 3 — IA multimodal para vídeo, imagen y audioMultimodal

El modelo base de nueva generación de Black Forest Labs. FLUX 3 aprende imagen, vídeo y audio juntos — para que movimiento, sonido y estructura sean más coherentes. Genera clips con audio nativo (a menudo hasta unos 20 segundos), continúa desde imágenes o vídeo y prepárate para una síntesis de imagen más fuerte.

Disponible en SeedDance — FLUX 3 Video (acceso anticipado)

Resumen multimodal de FLUX 3

Una columna vertebral para la inteligencia visual

FLUX 3 es el modelo base multimodal de Black Forest Labs anunciado en 2026. A diferencia de lanzamientos FLUX anteriores centrados en imagen, FLUX 3 se entrena de forma conjunta en imagen, vídeo y audio con la arquitectura Self-Flow. Las superficies de producto se despliegan como FLUX 3 Video, FLUX 3 Image, FLUX 3 Action y más adelante FLUX 3 Dev (pesos abiertos).

Vídeo + audio nativo

Genera clips variados con habla, efectos y ambiente sincronizados en una sola pasada. Los materiales tempranos destacan longitudes de una generación a menudo de hasta unos 20 segundos (resolución y modo según la API del proveedor).

Entradas de texto, imagen y vídeo

Parte de un prompt (texto a vídeo), fija imágenes como fotogramas (imagen a vídeo) o continúa un clip existente (continuación de vídeo) manteniendo personajes y contexto.

Síntesis de imagen más fuerte

FLUX 3 Image busca un mejor seguimiento de prompts complejos y texto multilingüe preciso en el fotograma — con acceso anticipado tras el nivel de vídeo.

Generación coherente con el mundo

El entrenamiento conjunto entre modalidades busca que el sonido coincida con el impacto, el movimiento respete la estructura y las secuencias multiplano sean más coherentes.

Hecho para movimiento, sonido y estilo coherentes

FLUX 3 está pensado para creadores y equipos que necesitan más que un solo fotograma bello: vídeo narrativo corto con audio, continuidad basada en referencias y trabajo de imagen con prompts densos.

El audio nativo combina diálogo orientado a la escena con efectos y ambiente ligados a eventos físicos — reduciendo la necesidad de montar una banda sonora aparte en muchos borradores.

Audio nativo de FLUX 3

Resumen de capacidades de FLUX 3

Capacidades principales de FLUX 3 Video en SeedDance. Las opciones coinciden con el generador de vídeo IA (duración, resolución, borrador, audio y entradas).

Texto a vídeo

Describe escena, cámara, estilo y diálogo en lenguaje natural para generar un vídeo corto con audio nativo opcional.

Imagen a vídeo

Una imagen abre el clip píxel a píxel; dos definen inicio y fin; de tres a diez actúan como storyboard (duración explícita obligatoria). Imágenes y vídeo de inicio no se pueden combinar.

Continuación de vídeo

Sube un mp4 corto (≤15 s, ≤50 MB) como start_video para continuar desde los fotogramas finales. No se puede combinar con entradas de imagen.

Vista previa en borrador

Genera un borrador 720p rápido y de menor coste para iterar el prompt antes de una ejecución completa a 720p o 1080p.

Audio sincronizado

El audio está activado por defecto (ambiente, habla, efectos). Desactívalo para un clip silencioso.

Síntesis y edición de imagen

FLUX 3 Image apunta a un amplio rango de estilos, encuadres flexibles y mejor texto en imagen — con acceso anticipado a la API tras el nivel de vídeo.

Preguntas frecuentes

Preguntas habituales sobre FLUX 3 y modelos relacionados en SeedDance.








Crea con FLUX 3 Video en SeedDance

Abre el generador de vídeo IA, selecciona FLUX 3 y genera clips con audio nativo opcional — desde texto, imágenes o un vídeo de inicio.