xAIのGrok Imagine Video 1.5は、ネイティブ同期音声付きのシネマティッククリップを生成——動きがより強く、発話同期がより明確、物理感のある相互作用を一度に。SeeVidではテキスト/画像/参照から動画(最大7枚)、1〜15秒、480p・720p・1080p。
SeeVidプラットフォームで利用可能

Grok Imagine Video 1.5はAuroraエンジンを基盤とするxAIの動画モデルで、ネイティブ同期音声を備えます。SeeVidではテキストから動画、画像から動画(先頭フレーム1枚)、参照から動画(2〜7枚)に対応し、480p / 720p / 1080p、長さ1〜15秒です。
SeeVidでは、1つのGrok Imagine Video 1.5が3モードをカバー:プロンプトのみのテキストから動画、先頭フレーム用画像1枚、または2〜7枚の参照画像を1本のショットにブレンド。より細部が必要な場合は1080pも選択可能。
音声は動画と一度に生成——環境音、効果音、音楽の手がかり、短い台詞が画面上の動作に合わせられます。1.5は1.0と比べ、発話の明瞭さと全体の音質が向上しています。
すべての制御がソースフレームのアニメ化向けに調整されています:視覚的アイデンティティの保持、スタイルの一致、テキストだけから新しい被写体を作るのではなく、シーンに合う動きの生成。
xAIによると、1.0より顔の精度とキャラクター一貫性が向上——ポートレートアニメーションやキャラクター駆動クリップに有用。実在の人物を使う場合は肖像権とプラットフォーム規約を必ず遵守してください。
よりクリアな音声、強化されたフォトリアリズム、安定したプロンプト追従を備えたAuroraエンジン動画生成——テキスト/画像/参照モードを、SeeVidの長さ・解像度制限内で。

SeeVid AI動画ジェネレーターでGrok Imagine Video 1.5に公開されている機能。
ポートレート、商品写真、イラスト、コンセプトアートなど静止画1枚を先頭フレームとしてアップロードし、動きを記述します。
2〜7枚の参照画像を1本の連続したシネマティックショットにブレンドし、プロンプトで動きを誘導します。
環境音、効果音、音楽の手がかり、台詞が動画と一緒に生成。プロンプトまたはAUDIO: セクションで音声を誘導できます。
高速・低コストの下書きには480p、より鮮明な納品には720p HD、細部が必要なら1080pを選択。
1〜15秒のクリップを生成。約5〜8秒は多くの場合より安定;長いクリップは多ビートのアクションに余地を与えます。
アスペクト比はこのモデルの生成器で利用可能な設定に従います。画像/参照モードでは、出力は多くの場合ソース画像の構図に沿います。
xAIのAuroraエンジンを基盤に、短尺クリップで重力、運動量、衝突、流体、布のような動きをより自然に。
パン、チルト、ズーム、ドリー、トラッキング、オービット、空撮、手持ち、ゆっくりしたプッシュインなどをプロンプトで直接記述。
しゃがむ→ダッシュ→観客が反応、のように動作を順に列挙すると、モデルは選択した長さ内で多段の動きを一貫させようとします。
SeeVid上のGrok Imagine Video 1.5について知っておくべきこと。
SeeVidでGrok Imagine Video 1.5を試す——テキスト/画像/参照モード、同期音声とAuroraエンジンの動き、最大1080p・15秒。