SeedDance上のByteDance Seedフルシーン音声モデル。単一プロンプトから多キャラ対話、感情表現、環境音、効果音を編成——1回の生成で最大約2分の音声。
SeedDanceプラットフォームで利用可能

Seed Audio 1.0は、ByteDance Seedチームのマルチモーダル音声制作モデルです。単一声トラックを出力する従来のテキスト読み上げと異なり、対話とその周囲の音響世界を含む完全なサウンドシーンを生成します。SeedDanceでは、テキストプロンプト(最大1,500文字)から作成でき、任意で最大3本のリファレンス音声または1枚のリファレンス画像を条件付けて、最大約2分の出力が可能です。
従来のTTSはテキストを一つの声にします。Seed Audio 1.0は対話、環境音、効果音、場面の質感を重ねたフルサウンドスケープを目指します。自然言語で場面を記述し、複数ツールを繋ぐ代わりに聴けるミックスを得ます。
最大3本のリファレンスクリップをアップロードし、プロンプト内で@Audio1、@Audio2、@Audio3とタグ付けして声のスタイルを導けます。音声リファレンスを使わない場合は、ムード用にリファレンス画像を1枚使えます——同じ生成で画像と音声リファレンスは併用できません。
それぞれ音色と感情の弧が異なる話者による会話を生成。複数の声優を録音せずに、脚本ポッドキャスト、研修シナリオ、キャラクター主導の物語に便利です。
環境アンビエンスとアクションに合わせた効果音を、共有の場面文脈で発話と一緒に生成——プロトタイプや短尺向けの別途SFX探しとラフミックスを減らせます。
SeedDance AI音声ジェネレーターで利用可能な機能——プロンプト、リファレンス、出力長の明確な上限付き。

SeedDance AI音声ジェネレーターでSeed Audio 1.0向けに公開されている機能。
自然言語でキャラクター、設定、ムード、ペースを記述(最大1,500文字)。モデルは平坦なナレーションではなく完全な音声シーンをレンダリングします。
最大3本のリファレンスクリップ(通常各最大30秒・10MB)をアップロードし、声のスタイルとキャストに@Audio1、@Audio2、@Audio3で参照。
音声リファレンスを使わないとき、ムードに影響させる単一のリファレンス画像(JPEG、PNG、またはWebP)を指定。画像と音声リファレンスは排他です。
脚本会話、インタビュー、物語のやり取り向けに、1回の生成で複数話者に異なる声を割り当て。
対話とともにアンビエントサウンドデザインを生成——雨、足音、都市ノイズ、機械のハムなど、プロンプトで記述した場面レイヤー。
プロンプトでセリフの入りを指定。キャラクター対話の公式タイミング制御は約100ms間隔——吹き替えや時間指定脚本に便利。
中国語、英語、日本語、韓国語、スペイン語など、公式に20以上の言語で表現力あるシーン音声を生成——ローカライズ下書きに有用。
SeedDanceの1回の生成で最大約2分の音声——ポッドキャストイントロ、広告スポット、短いドラマシーンに十分。
SeedDance上のSeed Audio 1.0について知っておくべきこと。
フルシーンAI音声を試す——テキストと任意のリファレンスから多キャラ対話、環境音、効果音を、1回の生成で最大約2分。