Seed Audio 1.0 — 一次生成全场景 AI 音频全场景音频

在 SeedDance 使用字节跳动 Seed 全场景音频模型。从单一提示词编排多角色对白、情绪表达、氛围与音效,单次最长约两分钟。

已在 SeedDance 平台上线

Seed Audio 1.0 概览

什么是 Seed Audio 1.0

Seed Audio 1.0 是字节跳动 Seed 团队的多模态音频创作模型。不同于只输出单一旁白的传统 TTS,它生成完整声音场景——对白及其所处的声场。在 SeedDance 上可用文本提示(最多 1,500 字符)生成,并可选最多 3 段参考音频或 1 张参考图,单次输出最长约两分钟。

超越文本转语音

传统 TTS 只生成一条人声。Seed Audio 1.0 面向完整声景:对白、氛围、音效与场景质感一次编排。用自然语言描述场景,即可获得可听混音,而不是跨多个工具拼接。

参考音频或参考图

最多上传 3 段参考音频,并在提示词中用 @Audio1、@Audio2、@Audio3 引导音色;或不使用参考音频时,改用 1 张参考图影响氛围。参考音频与参考图不可同次使用。

多角色对话与情绪

一次生成多位说话人,各自音色与情绪弧线不同,适合脚本播客、培训场景与角色叙事,无需多位配音演员。

氛围与音效一次完成

可在同一场景上下文中随对白生成环境声与动作音效,减少原型与短内容阶段的素材检索与粗混工作。

在 SeedDance 上用 Seed Audio 1.0 能做什么

AI 音频生成器中已开放的能力——提示词、参考输入与输出时长边界清晰可查。

在同一场景描述下统筹对白、氛围与音效线索。深夜便利店悬疑广播剧可一次包含低语对白、荧光灯嗡鸣、门铃与紧张铺垫——无需完整录音棚也能快速出草稿。

一条提示一条混音

SeedDance 上的 Seed Audio 1.0 功能集

AI 音频生成器中已对 Seed Audio 1.0 开放的能力。

文本生成音频场景

用自然语言描述角色、场景、情绪与节奏(最多 1,500 字符),生成完整声景而非单一旁白。

参考音频条件控制

上传最多 3 段参考音频(通常每段最长约 30 秒、10MB),在提示词中用 @Audio1/@Audio2/@Audio3 引导音色与角色分配。

可选参考图片

可上传 1 张参考图(JPEG/PNG/WebP)影响氛围;与参考音频互斥。

多角色对话

一次生成多位说话人,支持脚本对话、访谈与叙事交流。

氛围与环境音效

可随对白生成环境声设计——雨声、脚步、城市噪声、机械嗡鸣等,由提示词描述。

提示词级对白时序

可在提示词中指定台词进入时机。官方对角色对白的时序控制精度约 100ms,适合配音与对时脚本。

多语言场景音频

官方支持 20+ 语言的表现力场景音频,包括中文、英文、日语、韩语、西班牙语等,便于本地化草稿。

最长约 2 分钟输出

在 SeedDance 上单次最长约两分钟,适合播客片头、广告与短剧场景。

常见问题

关于在 SeedDance 上使用 Seed Audio 1.0 的说明。









在 SeedDance 开始使用 Seed Audio 1.0

体验全场景 AI 音频——多角色对白、氛围与音效,支持文本与可选参考,单次最长约两分钟。