Seed Audio 1.0 — полносценовое ИИ-аудио за одну генерациюполносценовое аудио

Полносценовая аудиомодель ByteDance Seed на SeedDance. Оркестрируйте многоперсонажный диалог, эмоциональную подачу, атмосферу и звуковые эффекты из одного промпта — до примерно двух минут аудио на генерацию.

Доступно на платформе SeedDance

Обзор Seed Audio 1.0

Что такое Seed Audio 1.0

Seed Audio 1.0 — мультимодальная модель создания аудио команды ByteDance Seed. В отличие от обычного text-to-speech, который выдаёт одну голосовую дорожку, она генерирует полные звуковые сцены — диалог плюс акустический мир вокруг. На SeedDance вы создаёте из текстового промпта (до 1500 символов), опционально с условием до трёх референсных аудиоклипов или одного референсного изображения, с выходом до примерно двух минут.

Дальше text-to-speech

Традиционный TTS превращает текст в один голос. Seed Audio 1.0 нацелен на полный саундскейп: диалог, атмосфера, эффекты и текстура сцены слоями. Опишите сцену естественным языком и получите прослушиваемый микс вместо склейки нескольких инструментов.

Референсное аудио или изображение

Загрузите до трёх референсных клипов и отметьте их в промпте как @Audio1, @Audio2 и @Audio3, чтобы направлять стиль голоса. Или используйте одно референсное изображение для настроения, если не используете аудиореференсы — изображение и аудиореференсы нельзя комбинировать в одной генерации.

Многоролевой диалог и эмоции

Генерируйте разговоры с разными говорящими, у каждого свой тембр и эмоциональная дуга. Полезно для сценарных подкастов, учебных сценариев и персонажного сторителлинга без записи нескольких актёров озвучки.

Атмосфера и SFX за один проход

Окружающая атмосфера и эффекты под действие могут генерироваться вместе с речью в общем контексте сцены — меньше отдельного поиска SFX и черновых миксов для прототипов и короткого формата.

Что можно делать с Seed Audio 1.0 на SeedDance

Возможности в ИИ-генераторе аудио SeedDance — с ясными лимитами для промптов, референсов и длины выхода.

Координируйте диалог, атмосферу и звуковые cues под одним описанием сцены. Ночная радиопьеса в магазине у дома может включать шёпот, гул ламп, дверные колокольчики и напряжённый underscore из одной инструкции — быстрые черновики без полного студийного стека.

Один промпт один микс

Набор функций SeedDance для Seed Audio 1.0

Возможности ИИ-генератора аудио SeedDance для Seed Audio 1.0.

Генерация сцены текст → аудио

Опишите персонажей, сеттинг, настроение и темп естественным языком (до 1500 символов). Модель рендерит полную аудиосцену, а не плоскую дорожку наррации.

Кондиционирование референсным аудио

Загрузите до трёх референсных клипов (обычно до 30 секунд и 10 МБ каждый) и ссылайтесь на них через @Audio1, @Audio2, @Audio3 для стиля голоса и кастинга персонажей.

Опциональный референс изображения

Укажите одно референсное изображение (JPEG, PNG или WebP), чтобы влиять на настроение, когда аудиореференсы не используются. Референсы изображения и аудио взаимоисключающи.

Многоперсонажный диалог

Назначайте разные голоса нескольким говорящим в одной генерации для сценарных разговоров, интервью и нарративных обменов.

Атмосфера и средовые FX

Генерируйте ambient sound design вместе с диалогом — дождь, шаги, городской шум, механический гул и другие слои сцены, описанные в промпте.

Тайминг диалога на уровне промпта

Укажите в промпте, когда должны вступать реплики. Официальное управление таймингом диалога персонажей доступно с интервалом около 100 мс — полезно для дубляжа и синхронизированных сценариев.

Многоязычное сценическое аудио

Генерируйте выразительное сценическое аудио на многих языках (официально 20+), включая китайский, английский, японский, корейский, испанский и другие — полезно для локализованных черновиков.

Выход до ~2 минут

Получайте до примерно двух минут аудио за одну генерацию SeedDance — достаточно для интро подкастов, рекламных роликов и коротких драматических сцен.

Часто задаваемые вопросы

Всё, что нужно знать о Seed Audio 1.0 на SeedDance.









Начните создавать с Seed Audio 1.0 на SeedDance

Попробуйте полносценовое ИИ-аудио — многоперсонажный диалог, атмосфера и эффекты из текста и опциональных референсов, до примерно двух минут на генерацию.