Seed Audio 1.0 — Audio IA scène complète en une générationAudio scène complète

Modèle audio scène complète ByteDance Seed sur SeedDance. Orchestrez dialogue multi-personnages, jeu émotionnel, ambiance et effets sonores à partir d’un seul prompt — jusqu’à environ deux minutes d’audio par génération.

Disponible sur la plateforme SeedDance

Aperçu de Seed Audio 1.0

Qu’est-ce que Seed Audio 1.0

Seed Audio 1.0 est un modèle multimodal de création audio de l’équipe Seed de ByteDance. Contrairement au text-to-speech classique qui sort une seule piste vocale, il génère des scènes sonores complètes — dialogue plus le monde acoustique autour. Sur SeedDance vous créez à partir d’un prompt texte (jusqu’à 1 500 caractères), optionnellement conditionné avec jusqu’à trois clips audio de référence ou une image de référence, pour des sorties jusqu’à environ deux minutes.

Au-delà du text-to-speech

Le TTS traditionnel transforme le texte en une voix. Seed Audio 1.0 vise le paysage sonore complet : dialogue, ambiance, effets et texture de scène en couches. Décrivez une scène en langage naturel et obtenez un mix écoutable au lieu d’enchaîner plusieurs outils.

Audio ou image de référence

Téléversez jusqu’à trois clips de référence et étiquetez-les dans le prompt avec @Audio1, @Audio2 et @Audio3 pour guider le style vocal. Ou utilisez une image de référence pour l’ambiance sans références audio — image et audio de référence ne peuvent pas être combinés dans la même génération.

Dialogue multi-rôles & émotion

Générez des conversations avec des locuteurs distincts, chacun avec son timbre et son arc émotionnel. Utile pour podcasts scénarisés, scénarios de formation et récits à personnages sans enregistrer plusieurs comédiens.

Ambiance & SFX en une passe

Ambiance environnementale et effets sonores alignés sur l’action peuvent être générés avec la parole dans un contexte de scène partagé — moins de chasse SFX séparée et de rough mixes pour prototypes et formats courts.

Ce que vous pouvez faire avec Seed Audio 1.0 sur SeedDance

Capacités disponibles dans le générateur audio IA SeedDance — avec des limites claires pour prompts, références et durée de sortie.

Coordonnez dialogue, ambiance et indices sonores sous une description de scène. Un radiodrama de convenience store de nuit peut inclure répliques chuchotées, bourdonnement fluorescent, carillons de porte et underscore tendu depuis une seule instruction — brouillons plus rapides sans stack studio complet.

Un prompt un mix

Jeu de fonctionnalités SeedDance pour Seed Audio 1.0

Capacités exposées dans le générateur audio IA SeedDance pour Seed Audio 1.0.

Génération de scène texte vers audio

Décrivez personnages, décor, humeur et rythme en langage naturel (jusqu’à 1 500 caractères). Le modèle rend une scène audio complète plutôt qu’une piste de narration plate.

Conditionnement par audio de référence

Téléversez jusqu’à trois clips de référence (typiquement jusqu’à 30 secondes et 10 Mo chacun) et référencez-les avec @Audio1, @Audio2, @Audio3 pour style vocal et casting de personnages.

Référence image optionnelle

Fournissez une seule image de référence (JPEG, PNG ou WebP) pour influencer l’ambiance sans références audio. Les références image et audio sont mutuellement exclusives.

Dialogue multi-personnages

Attribuez des voix distinctes à plusieurs locuteurs en une génération pour conversations scénarisées, interviews et échanges narratifs.

Ambiance & FX environnementaux

Générez un sound design ambient avec le dialogue — pluie, pas, bruit urbain, bourdonnement mécanique et autres couches de scène décrites dans le prompt.

Timing de dialogue au niveau du prompt

Indiquez dans le prompt quand les répliques doivent entrer. Le contrôle officiel de timing du dialogue personnage est disponible par intervalles d’environ 100 ms — utile pour doublage et scripts cadencés.

Audio de scène multilingue

Générez un audio de scène expressif dans de nombreuses langues (officiellement 20+), dont chinois, anglais, japonais, coréen, espagnol et plus — utile pour brouillons localisés.

Sortie jusqu’à ~2 minutes

Produisez jusqu’à environ deux minutes d’audio en une génération SeedDance — assez pour intros podcast, spots pub et courtes scènes dramatiques.

Questions fréquentes

Tout ce qu’il faut savoir sur Seed Audio 1.0 sur SeedDance.









Commencer avec Seed Audio 1.0 sur SeedDance

Essayez l’audio IA scène complète — dialogue multi-personnages, ambiance et effets à partir de texte et de références optionnelles, jusqu’à environ deux minutes par génération.