在 SeedDance 使用字节跳动 Seed 全场景音频模型。从单一提示词编排多角色对白、情绪表达、氛围与音效,单次最长约两分钟。
已在 SeedDance 平台上线

Seed Audio 1.0 是字节跳动 Seed 团队的多模态音频创作模型。不同于只输出单一旁白的传统 TTS,它生成完整声音场景——对白及其所处的声场。在 SeedDance 上可用文本提示(最多 1,500 字符)生成,并可选最多 3 段参考音频或 1 张参考图,单次输出最长约两分钟。
传统 TTS 只生成一条人声。Seed Audio 1.0 面向完整声景:对白、氛围、音效与场景质感一次编排。用自然语言描述场景,即可获得可听混音,而不是跨多个工具拼接。
最多上传 3 段参考音频,并在提示词中用 @Audio1、@Audio2、@Audio3 引导音色;或不使用参考音频时,改用 1 张参考图影响氛围。参考音频与参考图不可同次使用。
一次生成多位说话人,各自音色与情绪弧线不同,适合脚本播客、培训场景与角色叙事,无需多位配音演员。
可在同一场景上下文中随对白生成环境声与动作音效,减少原型与短内容阶段的素材检索与粗混工作。
AI 音频生成器中已开放的能力——提示词、参考输入与输出时长边界清晰可查。

AI 音频生成器中已对 Seed Audio 1.0 开放的能力。
用自然语言描述角色、场景、情绪与节奏(最多 1,500 字符),生成完整声景而非单一旁白。
上传最多 3 段参考音频(通常每段最长约 30 秒、10MB),在提示词中用 @Audio1/@Audio2/@Audio3 引导音色与角色分配。
可上传 1 张参考图(JPEG/PNG/WebP)影响氛围;与参考音频互斥。
一次生成多位说话人,支持脚本对话、访谈与叙事交流。
可随对白生成环境声设计——雨声、脚步、城市噪声、机械嗡鸣等,由提示词描述。
可在提示词中指定台词进入时机。官方对角色对白的时序控制精度约 100ms,适合配音与对时脚本。
官方支持 20+ 语言的表现力场景音频,包括中文、英文、日语、韩语、西班牙语等,便于本地化草稿。
在 SeedDance 上单次最长约两分钟,适合播客片头、广告与短剧场景。
关于在 SeedDance 上使用 Seed Audio 1.0 的说明。