Seed Audio 1.0 — 一度の生成でフルシーンAI音声フルシーン音声

SeedDance上のByteDance Seedフルシーン音声モデル。単一プロンプトから多キャラ対話、感情表現、環境音、効果音を編成——1回の生成で最大約2分の音声。

SeedDanceプラットフォームで利用可能

Seed Audio 1.0の概要

Seed Audio 1.0とは

Seed Audio 1.0は、ByteDance Seedチームのマルチモーダル音声制作モデルです。単一声トラックを出力する従来のテキスト読み上げと異なり、対話とその周囲の音響世界を含む完全なサウンドシーンを生成します。SeedDanceでは、テキストプロンプト(最大1,500文字)から作成でき、任意で最大3本のリファレンス音声または1枚のリファレンス画像を条件付けて、最大約2分の出力が可能です。

テキスト読み上げを超えて

従来のTTSはテキストを一つの声にします。Seed Audio 1.0は対話、環境音、効果音、場面の質感を重ねたフルサウンドスケープを目指します。自然言語で場面を記述し、複数ツールを繋ぐ代わりに聴けるミックスを得ます。

リファレンス音声または画像

最大3本のリファレンスクリップをアップロードし、プロンプト内で@Audio1、@Audio2、@Audio3とタグ付けして声のスタイルを導けます。音声リファレンスを使わない場合は、ムード用にリファレンス画像を1枚使えます——同じ生成で画像と音声リファレンスは併用できません。

多役対話と感情

それぞれ音色と感情の弧が異なる話者による会話を生成。複数の声優を録音せずに、脚本ポッドキャスト、研修シナリオ、キャラクター主導の物語に便利です。

環境音とSFXを一度に

環境アンビエンスとアクションに合わせた効果音を、共有の場面文脈で発話と一緒に生成——プロトタイプや短尺向けの別途SFX探しとラフミックスを減らせます。

SeedDanceでSeed Audio 1.0ができること

SeedDance AI音声ジェネレーターで利用可能な機能——プロンプト、リファレンス、出力長の明確な上限付き。

一つの場面説明の下で対話、環境音、サウンドキューを調整。深夜のコンビニラジオドラマに、ささやき声、蛍光灯のハム、ドアチャイム、緊張のアンダースコアを単一指示から含められます——フルスタジオなしで速い下書き。

一つのプロンプト一つのミックス

Seed Audio 1.0向けSeedDance機能セット

SeedDance AI音声ジェネレーターでSeed Audio 1.0向けに公開されている機能。

テキストから音声シーン生成

自然言語でキャラクター、設定、ムード、ペースを記述(最大1,500文字)。モデルは平坦なナレーションではなく完全な音声シーンをレンダリングします。

リファレンス音声による条件付け

最大3本のリファレンスクリップ(通常各最大30秒・10MB)をアップロードし、声のスタイルとキャストに@Audio1、@Audio2、@Audio3で参照。

任意の画像リファレンス

音声リファレンスを使わないとき、ムードに影響させる単一のリファレンス画像(JPEG、PNG、またはWebP)を指定。画像と音声リファレンスは排他です。

多キャラクター対話

脚本会話、インタビュー、物語のやり取り向けに、1回の生成で複数話者に異なる声を割り当て。

環境音と環境FX

対話とともにアンビエントサウンドデザインを生成——雨、足音、都市ノイズ、機械のハムなど、プロンプトで記述した場面レイヤー。

プロンプトレベル対話タイミング

プロンプトでセリフの入りを指定。キャラクター対話の公式タイミング制御は約100ms間隔——吹き替えや時間指定脚本に便利。

多言語シーン音声

中国語、英語、日本語、韓国語、スペイン語など、公式に20以上の言語で表現力あるシーン音声を生成——ローカライズ下書きに有用。

最大約2分の出力

SeedDanceの1回の生成で最大約2分の音声——ポッドキャストイントロ、広告スポット、短いドラマシーンに十分。

よくある質問

SeedDance上のSeed Audio 1.0について知っておくべきこと。









SeedDanceでSeed Audio 1.0の作成を始める

フルシーンAI音声を試す——テキストと任意のリファレンスから多キャラ対話、環境音、効果音を、1回の生成で最大約2分。