Alibaba Tongyi LabのWanxiang 2.6動画モデル。テキストまたは画像から、マルチショット物語、キャラクター/リファレンス一貫性、音と映像の同期を備えたナラティブクリップを生成——設定により最大約15秒、最大1080p。
Alibaba Tongyi Wanxiang提供
Wan 2.6(Tongyi Wanxiang 2.6)は、Alibaba Tongyi LabのAI動画生成モデルです。標準のテキストから動画・画像から動画に加え、マルチショット物語生成、リファレンス誘導のキャラクター一貫性、ネイティブな音と映像の同期に焦点を当てています。クリップ長と解像度はプロバイダー設定に依存します(一般的に最大約15秒・最大1080p)。
脚本風のプロンプトを一貫したショット列に変換。Wan 2.6は、単一ショットのクリップモデルより、カット間で被写体・場面・雰囲気の一貫性を保つよう設計されています。
動画に合わせた音声を生成——音声生成が有効な場合、対話向け口パク同期や環境音・効果音の手がかりを含み、多くの下書きで別途サウンドトラック組み立てを減らせます。
リファレンス画像やクリップを使い、新しい場面に配置する際のキャラクターの見た目(一部モードでは声も)をより安定させます——短い物語やIP風の下書きに便利です。
詳細なテキストプロンプトから始めるか、静止画をアニメーション化。16:9、9:16、1:1などのアスペクト比は、選択する生成設定に応じて一般的にサポートされます。
Wan 2.6は、単一の美しいショットと同じくらい、マルチショット構成と同期音声が重要な短尺ナラティブやマーケ下書き向けです。
Alibaba Tongyi Wanxiang 2.6動画生成と一般的に関連するコア機能。
自然言語で場面、アクション、カメラ、スタイルを記述し、短い動画クリップを生成。
ソースフレームの被写体アイデンティティと構図を保ちながら、静止画をアニメーション化。
複数ショットや絵コンテ風セグメントをプロンプトし、単一連続テイクではなく短い物語として読めるクリップに。
映像と同期した音声を任意で生成。対話がプロンプトに含まれる場合は発話向け同期も含む。
新しく生成した場面でキャラクター外見やスタイル連続性を導くためにリファレンスを使用(利用可否は生成モードによる)。
横長・縦長・正方形など一般的なアスペクト比で、フィード、ストーリー、サイト埋め込みに合わせやすく。
Wan 2.6とSeeVidのAI動画ツールに関するよくある質問。