Modelo de audio de escena completa de ByteDance Seed en SeedDance. Orquesta diálogo multicanácter, entrega emocional, ambiente y efectos de sonido desde un solo prompt — hasta unos dos minutos de audio por generación.
Disponible en la plataforma SeedDance

Seed Audio 1.0 es un modelo multimodal de creación de audio del equipo Seed de ByteDance. A diferencia del texto a voz convencional que produce una sola pista de voz, genera escenas sonoras completas — diálogo más el mundo acústico a su alrededor. En SeedDance puedes crear desde un prompt de texto (hasta 1.500 caracteres), opcionalmente condicionado con hasta tres clips de audio de referencia o una imagen de referencia, para salidas de hasta unos dos minutos.
El TTS tradicional convierte texto en una voz. Seed Audio 1.0 apunta al paisaje sonoro completo: diálogo, ambiente, efectos y textura de escena en capas. Describe una escena en lenguaje natural y obtén una mezcla escuchable en lugar de encadenar varias herramientas.
Sube hasta tres clips de referencia y etiquétalos en el prompt con @Audio1, @Audio2 y @Audio3 para guiar el estilo de voz. O usa una imagen de referencia para el ambiente cuando no uses referencias de audio — imagen y audio de referencia no se pueden combinar en la misma generación.
Genera conversaciones con hablantes distintos, cada uno con su propia timbre y arco emocional. Útil para podcasts guionizados, escenarios de formación y relatos con personajes sin grabar a varios actores de voz.
El ambiente ambiental y los efectos de sonido alineados con la acción pueden generarse junto al habla en un contexto de escena compartido — reduciendo búsquedas separadas de SFX y mezclas en bruto para prototipos y contenido corto.
Capacidades disponibles en el generador de audio AI de SeedDance — con límites claros para prompts, referencias y duración de salida.

Capacidades expuestas en el generador de audio AI de SeedDance para Seed Audio 1.0.
Describe personajes, ambientación, estado de ánimo y ritmo en lenguaje natural (hasta 1.500 caracteres). El modelo renderiza una escena de audio completa en lugar de una pista de narración plana.
Sube hasta tres clips de referencia (típicamente hasta 30 segundos y 10 MB cada uno) y refiérete a ellos con @Audio1, @Audio2, @Audio3 para estilo de voz y casting de personajes.
Proporciona una sola imagen de referencia (JPEG, PNG o WebP) para influir en el ambiente cuando no uses referencias de audio. Las referencias de imagen y audio son mutuamente excluyentes.
Asigna voces distintas a varios hablantes en una generación para conversaciones guionizadas, entrevistas e intercambios narrativos.
Genera diseño sonoro ambiental con el diálogo — lluvia, pasos, ruido urbano, zumbido mecánico y otras capas de escena descritas en el prompt.
Especifica en el prompt cuándo deben entrar las líneas. El control oficial de temporización del diálogo de personajes está disponible en intervalos de unos 100 ms — útil para doblaje y guiones sincronizados.
Genera audio de escena expresivo en muchos idiomas (oficialmente más de 20), incluidos chino, inglés, japonés, coreano, español y más — útil para borradores localizados.
Produce hasta unos dos minutos de audio en una sola generación de SeedDance — suficiente para intros de podcast, spots publicitarios y escenas dramáticas cortas.
Todo lo que necesitas saber sobre Seed Audio 1.0 en SeedDance.
Prueba audio AI de escena completa — diálogo multicanácter, ambiente y efectos a partir de texto y referencias opcionales, hasta unos dos minutos por generación.