Seed Audio 1.0 — Audio AI de escena completa en una generaciónAudio de escena completa

Modelo de audio de escena completa de ByteDance Seed en SeedDance. Orquesta diálogo multicanácter, entrega emocional, ambiente y efectos de sonido desde un solo prompt — hasta unos dos minutos de audio por generación.

Disponible en la plataforma SeedDance

Resumen de Seed Audio 1.0

Qué es Seed Audio 1.0

Seed Audio 1.0 es un modelo multimodal de creación de audio del equipo Seed de ByteDance. A diferencia del texto a voz convencional que produce una sola pista de voz, genera escenas sonoras completas — diálogo más el mundo acústico a su alrededor. En SeedDance puedes crear desde un prompt de texto (hasta 1.500 caracteres), opcionalmente condicionado con hasta tres clips de audio de referencia o una imagen de referencia, para salidas de hasta unos dos minutos.

Más allá del texto a voz

El TTS tradicional convierte texto en una voz. Seed Audio 1.0 apunta al paisaje sonoro completo: diálogo, ambiente, efectos y textura de escena en capas. Describe una escena en lenguaje natural y obtén una mezcla escuchable en lugar de encadenar varias herramientas.

Audio o imagen de referencia

Sube hasta tres clips de referencia y etiquétalos en el prompt con @Audio1, @Audio2 y @Audio3 para guiar el estilo de voz. O usa una imagen de referencia para el ambiente cuando no uses referencias de audio — imagen y audio de referencia no se pueden combinar en la misma generación.

Diálogo multirrol y emoción

Genera conversaciones con hablantes distintos, cada uno con su propia timbre y arco emocional. Útil para podcasts guionizados, escenarios de formación y relatos con personajes sin grabar a varios actores de voz.

Ambiente y SFX en una pasada

El ambiente ambiental y los efectos de sonido alineados con la acción pueden generarse junto al habla en un contexto de escena compartido — reduciendo búsquedas separadas de SFX y mezclas en bruto para prototipos y contenido corto.

Qué puedes hacer con Seed Audio 1.0 en SeedDance

Capacidades disponibles en el generador de audio AI de SeedDance — con límites claros para prompts, referencias y duración de salida.

Coordina diálogo, ambiente y cues de sonido bajo una descripción de escena. Un radioteatro de tienda de conveniencia de madrugada puede incluir líneas susurradas, zumbido fluorescente, campanillas de puerta y underscore tenso desde una sola instrucción — borradores más rápidos sin un stack de estudio completo.

Un prompt una mezcla

Conjunto de funciones SeedDance para Seed Audio 1.0

Capacidades expuestas en el generador de audio AI de SeedDance para Seed Audio 1.0.

Generación de escena texto a audio

Describe personajes, ambientación, estado de ánimo y ritmo en lenguaje natural (hasta 1.500 caracteres). El modelo renderiza una escena de audio completa en lugar de una pista de narración plana.

Condicionamiento con audio de referencia

Sube hasta tres clips de referencia (típicamente hasta 30 segundos y 10 MB cada uno) y refiérete a ellos con @Audio1, @Audio2, @Audio3 para estilo de voz y casting de personajes.

Referencia de imagen opcional

Proporciona una sola imagen de referencia (JPEG, PNG o WebP) para influir en el ambiente cuando no uses referencias de audio. Las referencias de imagen y audio son mutuamente excluyentes.

Diálogo multicanácter

Asigna voces distintas a varios hablantes en una generación para conversaciones guionizadas, entrevistas e intercambios narrativos.

Ambiente y FX ambientales

Genera diseño sonoro ambiental con el diálogo — lluvia, pasos, ruido urbano, zumbido mecánico y otras capas de escena descritas en el prompt.

Temporización de diálogo a nivel de prompt

Especifica en el prompt cuándo deben entrar las líneas. El control oficial de temporización del diálogo de personajes está disponible en intervalos de unos 100 ms — útil para doblaje y guiones sincronizados.

Audio de escena multilingüe

Genera audio de escena expresivo en muchos idiomas (oficialmente más de 20), incluidos chino, inglés, japonés, coreano, español y más — útil para borradores localizados.

Salida de hasta ~2 minutos

Produce hasta unos dos minutos de audio en una sola generación de SeedDance — suficiente para intros de podcast, spots publicitarios y escenas dramáticas cortas.

Preguntas frecuentes

Todo lo que necesitas saber sobre Seed Audio 1.0 en SeedDance.









Empieza a crear con Seed Audio 1.0 en SeedDance

Prueba audio AI de escena completa — diálogo multicanácter, ambiente y efectos a partir de texto y referencias opcionales, hasta unos dos minutos por generación.