ByteDance-Seeds Full-Scene-Audiomodell auf SeedDance. Orchestrieren Sie Mehrfiguren-Dialog, emotionale Darbietung, Ambient und Soundeffekte aus einem Prompt — bis etwa zwei Minuten Audio pro Generierung.
Verfügbar auf der SeedDance-Plattform

Seed Audio 1.0 ist ein multimodales Audio-Erstellungsmodell des ByteDance-Seed-Teams. Anders als konventionelle Text-zu-Sprache, die eine einzelne Spur ausgibt, erzeugt es vollständige Klangszenen — Dialog plus die akustische Welt darum herum. Auf SeedDance erstellen Sie aus einem Textprompt (bis 1.500 Zeichen), optional konditioniert mit bis zu drei Referenz-Audioclips oder einem Referenzbild, Ausgaben bis etwa zwei Minuten.
Klassisches TTS macht aus Text eine Stimme. Seed Audio 1.0 zielt auf die volle Klanglandschaft: Dialog, Ambient, Effekte und Szenentextur übereinander. Beschreiben Sie eine Szene in natürlicher Sprache und erhalten Sie einen hörbaren Mix statt vieler Tools zu verketten.
Laden Sie bis zu drei Referenzclips hoch und taggen Sie sie im Prompt mit @Audio1, @Audio2 und @Audio3, um den Stimmstil zu führen. Oder nutzen Sie ein Referenzbild für die Stimmung, wenn Sie keine Audio-Referenzen verwenden — Bild- und Audio-Referenzen lassen sich in derselben Generierung nicht kombinieren.
Erzeugen Sie Gespräche mit unterscheidbaren Sprechern, jeweils mit eigener Timbre und emotionalem Bogen. Nützlich für skriptierte Podcasts, Trainingszenarien und charaktergeführtes Storytelling ohne mehrere Synchronsprecher aufzunehmen.
Umgebungsambient und aktionspassende Soundeffekte können zusammen mit Sprache in einem gemeinsamen Szenenkontext erzeugt werden — weniger separates SFX-Suchen und Rough-Mixes für Prototypen und Short-Form.
Fähigkeiten im SeedDance-KI-Audiogenerator — mit klaren Limits für Prompts, Referenzen und Ausgabelänge.

Im SeedDance-KI-Audiogenerator für Seed Audio 1.0 freigegebene Fähigkeiten.
Beschreiben Sie Charaktere, Setting, Stimmung und Tempo in natürlicher Sprache (bis 1.500 Zeichen). Das Modell rendert eine vollständige Audioszene statt einer flachen Narrationsspur.
Laden Sie bis zu drei Referenzclips hoch (typisch bis 30 Sekunden und 10 MB je) und referenzieren Sie sie mit @Audio1, @Audio2, @Audio3 für Stimmstil und Charaktercasting.
Liefern Sie ein einzelnes Referenzbild (JPEG, PNG oder WebP), um die Stimmung zu beeinflussen, wenn keine Audio-Referenzen genutzt werden. Bild- und Audio-Referenzen schließen sich gegenseitig aus.
Weisen Sie mehreren Sprechern in einer Generierung unterschiedliche Stimmen zu — für skriptierte Gespräche, Interviews und narrative Austausche.
Erzeugen Sie Ambient-Sounddesign mit Dialog — Regen, Schritte, Stadtlärm, mechanisches Brummen und andere im Prompt beschriebene Szenenschichten.
Legen Sie im Prompt fest, wann Zeilen einsetzen. Offizielle Timing-Kontrolle für Charakterdialog ist in etwa 100-ms-Intervallen verfügbar — nützlich für Dubbing und getaktete Skripte.
Erzeugen Sie ausdrucksstarkes Szenen-Audio in vielen Sprachen (offiziell 20+), darunter Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch und mehr — nützlich für lokalisierte Entwürfe.
Erzeugen Sie bis etwa zwei Minuten Audio in einer SeedDance-Generierung — genug für Podcast-Intros, Ad-Spots und kurze Dramaszenen.
Alles Wissenswerte zu Seed Audio 1.0 auf SeedDance.
Probieren Sie Full-Scene-KI-Audio — Mehrfiguren-Dialog, Ambient und Effekte aus Text und optionalen Referenzen, bis etwa zwei Minuten pro Generierung.