Полносценовая аудиомодель ByteDance Seed на SeedDance. Оркестрируйте многоперсонажный диалог, эмоциональную подачу, атмосферу и звуковые эффекты из одного промпта — до примерно двух минут аудио на генерацию.
Доступно на платформе SeedDance

Seed Audio 1.0 — мультимодальная модель создания аудио команды ByteDance Seed. В отличие от обычного text-to-speech, который выдаёт одну голосовую дорожку, она генерирует полные звуковые сцены — диалог плюс акустический мир вокруг. На SeedDance вы создаёте из текстового промпта (до 1500 символов), опционально с условием до трёх референсных аудиоклипов или одного референсного изображения, с выходом до примерно двух минут.
Традиционный TTS превращает текст в один голос. Seed Audio 1.0 нацелен на полный саундскейп: диалог, атмосфера, эффекты и текстура сцены слоями. Опишите сцену естественным языком и получите прослушиваемый микс вместо склейки нескольких инструментов.
Загрузите до трёх референсных клипов и отметьте их в промпте как @Audio1, @Audio2 и @Audio3, чтобы направлять стиль голоса. Или используйте одно референсное изображение для настроения, если не используете аудиореференсы — изображение и аудиореференсы нельзя комбинировать в одной генерации.
Генерируйте разговоры с разными говорящими, у каждого свой тембр и эмоциональная дуга. Полезно для сценарных подкастов, учебных сценариев и персонажного сторителлинга без записи нескольких актёров озвучки.
Окружающая атмосфера и эффекты под действие могут генерироваться вместе с речью в общем контексте сцены — меньше отдельного поиска SFX и черновых миксов для прототипов и короткого формата.
Возможности в ИИ-генераторе аудио SeedDance — с ясными лимитами для промптов, референсов и длины выхода.

Возможности ИИ-генератора аудио SeedDance для Seed Audio 1.0.
Опишите персонажей, сеттинг, настроение и темп естественным языком (до 1500 символов). Модель рендерит полную аудиосцену, а не плоскую дорожку наррации.
Загрузите до трёх референсных клипов (обычно до 30 секунд и 10 МБ каждый) и ссылайтесь на них через @Audio1, @Audio2, @Audio3 для стиля голоса и кастинга персонажей.
Укажите одно референсное изображение (JPEG, PNG или WebP), чтобы влиять на настроение, когда аудиореференсы не используются. Референсы изображения и аудио взаимоисключающи.
Назначайте разные голоса нескольким говорящим в одной генерации для сценарных разговоров, интервью и нарративных обменов.
Генерируйте ambient sound design вместе с диалогом — дождь, шаги, городской шум, механический гул и другие слои сцены, описанные в промпте.
Укажите в промпте, когда должны вступать реплики. Официальное управление таймингом диалога персонажей доступно с интервалом около 100 мс — полезно для дубляжа и синхронизированных сценариев.
Генерируйте выразительное сценическое аудио на многих языках (официально 20+), включая китайский, английский, японский, корейский, испанский и другие — полезно для локализованных черновиков.
Получайте до примерно двух минут аудио за одну генерацию SeedDance — достаточно для интро подкастов, рекламных роликов и коротких драматических сцен.
Всё, что нужно знать о Seed Audio 1.0 на SeedDance.
Попробуйте полносценовое ИИ-аудио — многоперсонажный диалог, атмосфера и эффекты из текста и опциональных референсов, до примерно двух минут на генерацию.