FLUX 3 — IA multimodal para vídeo, imagen y audioMultimodal

El modelo base de nueva generación de Black Forest Labs. FLUX 3 aprende imagen, vídeo y audio juntos — para que movimiento, sonido y estructura sean más coherentes. Genera clips con audio nativo (a menudo hasta unos 20 segundos) y continúa desde imágenes o vídeo cuando el nivel de vídeo esté disponible en SeeVid.

Próximamente en SeeVid — FLUX 3 Video

Resumen de generación de vídeo FLUX 3

Vídeo multimodal de Black Forest Labs

FLUX 3 es el modelo base multimodal de Black Forest Labs anunciado en 2026. A diferencia de lanzamientos FLUX anteriores centrados en imagen, FLUX 3 se entrena de forma conjunta en imagen, vídeo y audio con la arquitectura Self-Flow — buscando una comprensión compartida más sólida de cómo se sostienen los objetos, cómo se mueven y cómo suenan los eventos. En SeeVid, la superficie de producto prevista es solo FLUX 3 Video (entradas de texto, imagen y vídeo con audio nativo opcional).

Vídeo + audio nativo

Genera clips variados con habla, efectos y ambiente sincronizados en una sola pasada. Los materiales tempranos destacan longitudes de una generación a menudo de hasta unos 20 segundos (resolución y modo según la API del proveedor).

Entradas de texto, imagen y vídeo

Parte de un prompt (texto a vídeo), fija imágenes como fotogramas (imagen a vídeo) o continúa un clip existente (continuación de vídeo) manteniendo personajes y contexto.

Salida 720p y 1080p

Las opciones previstas en SeeVid incluyen 720p y 1080p, además de una vista previa rápida en borrador para iterar prompts antes de una ejecución a calidad completa.

Generación coherente con el mundo

El entrenamiento conjunto entre modalidades busca que el sonido coincida con el impacto, el movimiento respete la estructura y las secuencias multiplano sean más coherentes.

Hecho para movimiento, sonido y estilo coherentes

FLUX 3 está pensado para creadores y equipos que necesitan más que un solo fotograma bello: vídeo narrativo corto con audio y continuidad basada en referencias.

El audio nativo combina diálogo orientado a la escena con efectos y ambiente ligados a eventos físicos — reduciendo la necesidad de montar una banda sonora aparte en muchos borradores.

Audio nativo de FLUX 3

Resumen de capacidades de FLUX 3 Video

Capacidades previstas de FLUX 3 Video en SeeVid. Las opciones exactas coincidirán con el generador de vídeo IA cuando el modelo se restaure (duración, resolución, borrador, audio y entradas).

Texto a vídeo

Describe escena, cámara, estilo y diálogo en lenguaje natural para generar un vídeo corto con audio nativo opcional.

Imagen a vídeo

Una imagen abre el clip píxel a píxel; dos definen inicio y fin; de tres a diez actúan como storyboard (duración explícita obligatoria). Imágenes y vídeo de inicio no se pueden combinar.

Continuación de vídeo

Sube un mp4 corto (≤15 s, ≤50 MB) como start_video para continuar desde los fotogramas finales. No se puede combinar con entradas de imagen.

Vista previa en borrador

Genera un borrador 720p rápido y de menor coste para iterar el prompt antes de una ejecución completa a 720p o 1080p.

Audio sincronizado

El audio está activado por defecto (ambiente, habla, efectos). Desactívalo para un clip silencioso.

Duración 5–20 s o Auto

Elige un número entero de segundos de 5 a 20, o auto para que el modelo ajuste el contenido. Los storyboards con tres o más imágenes requieren una duración explícita.

Preguntas frecuentes

Preguntas habituales sobre FLUX 3 y la disponibilidad en SeeVid.








FLUX 3 Video llega pronto a SeeVid

Estamos preparando FLUX 3 Video para flujos de texto, imagen y vídeo de inicio con audio nativo opcional. Vuelve cuando regrese el acceso anticipado.