Modèle audio scène complète ByteDance Seed sur SeedDance. Orchestrez dialogue multi-personnages, jeu émotionnel, ambiance et effets sonores à partir d’un seul prompt — jusqu’à environ deux minutes d’audio par génération.
Disponible sur la plateforme SeedDance

Seed Audio 1.0 est un modèle multimodal de création audio de l’équipe Seed de ByteDance. Contrairement au text-to-speech classique qui sort une seule piste vocale, il génère des scènes sonores complètes — dialogue plus le monde acoustique autour. Sur SeedDance vous créez à partir d’un prompt texte (jusqu’à 1 500 caractères), optionnellement conditionné avec jusqu’à trois clips audio de référence ou une image de référence, pour des sorties jusqu’à environ deux minutes.
Le TTS traditionnel transforme le texte en une voix. Seed Audio 1.0 vise le paysage sonore complet : dialogue, ambiance, effets et texture de scène en couches. Décrivez une scène en langage naturel et obtenez un mix écoutable au lieu d’enchaîner plusieurs outils.
Téléversez jusqu’à trois clips de référence et étiquetez-les dans le prompt avec @Audio1, @Audio2 et @Audio3 pour guider le style vocal. Ou utilisez une image de référence pour l’ambiance sans références audio — image et audio de référence ne peuvent pas être combinés dans la même génération.
Générez des conversations avec des locuteurs distincts, chacun avec son timbre et son arc émotionnel. Utile pour podcasts scénarisés, scénarios de formation et récits à personnages sans enregistrer plusieurs comédiens.
Ambiance environnementale et effets sonores alignés sur l’action peuvent être générés avec la parole dans un contexte de scène partagé — moins de chasse SFX séparée et de rough mixes pour prototypes et formats courts.
Capacités disponibles dans le générateur audio IA SeedDance — avec des limites claires pour prompts, références et durée de sortie.

Capacités exposées dans le générateur audio IA SeedDance pour Seed Audio 1.0.
Décrivez personnages, décor, humeur et rythme en langage naturel (jusqu’à 1 500 caractères). Le modèle rend une scène audio complète plutôt qu’une piste de narration plate.
Téléversez jusqu’à trois clips de référence (typiquement jusqu’à 30 secondes et 10 Mo chacun) et référencez-les avec @Audio1, @Audio2, @Audio3 pour style vocal et casting de personnages.
Fournissez une seule image de référence (JPEG, PNG ou WebP) pour influencer l’ambiance sans références audio. Les références image et audio sont mutuellement exclusives.
Attribuez des voix distinctes à plusieurs locuteurs en une génération pour conversations scénarisées, interviews et échanges narratifs.
Générez un sound design ambient avec le dialogue — pluie, pas, bruit urbain, bourdonnement mécanique et autres couches de scène décrites dans le prompt.
Indiquez dans le prompt quand les répliques doivent entrer. Le contrôle officiel de timing du dialogue personnage est disponible par intervalles d’environ 100 ms — utile pour doublage et scripts cadencés.
Générez un audio de scène expressif dans de nombreuses langues (officiellement 20+), dont chinois, anglais, japonais, coréen, espagnol et plus — utile pour brouillons localisés.
Produisez jusqu’à environ deux minutes d’audio en une génération SeedDance — assez pour intros podcast, spots pub et courtes scènes dramatiques.
Tout ce qu’il faut savoir sur Seed Audio 1.0 sur SeedDance.
Essayez l’audio IA scène complète — dialogue multi-personnages, ambiance et effets à partir de texte et de références optionnelles, jusqu’à environ deux minutes par génération.