Grok Imagine Video 1.5 — 同期音声付き動画 AIテキスト · 画像 · 参照

xAIのGrok Imagine Video 1.5は、ネイティブ同期音声付きのシネマティッククリップを生成——動きがより強く、発話同期がより明確、物理感のある相互作用を一度に。SeeVidではテキスト/画像/参照から動画(最大7枚)、1〜15秒、480p・720p・1080p。

SeeVidプラットフォームで利用可能

Grok Imagine Video 1.5の概要

テキスト・画像・参照ワークフロー向けの xAI 動画モデル

Grok Imagine Video 1.5はAuroraエンジンを基盤とするxAIの動画モデルで、ネイティブ同期音声を備えます。SeeVidではテキストから動画、画像から動画(先頭フレーム1枚)、参照から動画(2〜7枚)に対応し、480p / 720p / 1080p、長さ1〜15秒です。

テキスト・画像・参照の3モード

SeeVidでは、1つのGrok Imagine Video 1.5が3モードをカバー:プロンプトのみのテキストから動画、先頭フレーム用画像1枚、または2〜7枚の参照画像を1本のショットにブレンド。より細部が必要な場合は1080pも選択可能。

同期音声の生成

音声は動画と一度に生成——環境音、効果音、音楽の手がかり、短い台詞が画面上の動作に合わせられます。1.5は1.0と比べ、発話の明瞭さと全体の音質が向上しています。

静画アニメーション専用設計

すべての制御がソースフレームのアニメ化向けに調整されています:視覚的アイデンティティの保持、スタイルの一致、テキストだけから新しい被写体を作るのではなく、シーンに合う動きの生成。

顔の精度とキャラクター一貫性

xAIによると、1.0より顔の精度とキャラクター一貫性が向上——ポートレートアニメーションやキャラクター駆動クリップに有用。実在の人物を使う場合は肖像権とプラットフォーム規約を必ず遵守してください。

SeeVidでGrok Imagine Video 1.5にできること

よりクリアな音声、強化されたフォトリアリズム、安定したプロンプト追従を備えたAuroraエンジン動画生成——テキスト/画像/参照モードを、SeeVidの長さ・解像度制限内で。

1.5は通常、より明瞭な発話、豊かな環境音、クリップに合った効果音タイミングを提供。プロンプトで音に言及するか、AUDIO: セクションで部屋のトーン、効果音、短い台詞を指定できます。

同期音声の生成

SeeVid上のGrok Imagine Video 1.5機能セット

SeeVid AI動画ジェネレーターでGrok Imagine Video 1.5に公開されている機能。

画像から動画アニメーション

ポートレート、商品写真、イラスト、コンセプトアートなど静止画1枚を先頭フレームとしてアップロードし、動きを記述します。

参照から動画(2〜7枚)

2〜7枚の参照画像を1本の連続したシネマティックショットにブレンドし、プロンプトで動きを誘導します。

ネイティブ同期音声

環境音、効果音、音楽の手がかり、台詞が動画と一緒に生成。プロンプトまたはAUDIO: セクションで音声を誘導できます。

480p / 720p / 1080p 解像度

高速・低コストの下書きには480p、より鮮明な納品には720p HD、細部が必要なら1080pを選択。

1〜15秒の長さ

1〜15秒のクリップを生成。約5〜8秒は多くの場合より安定;長いクリップは多ビートのアクションに余地を与えます。

柔軟なアスペクト比

アスペクト比はこのモデルの生成器で利用可能な設定に従います。画像/参照モードでは、出力は多くの場合ソース画像の構図に沿います。

Aurora物理エンジン

xAIのAuroraエンジンを基盤に、短尺クリップで重力、運動量、衝突、流体、布のような動きをより自然に。

シネマティックなカメラ制御

パン、チルト、ズーム、ドリー、トラッキング、オービット、空撮、手持ち、ゆっくりしたプッシュインなどをプロンプトで直接記述。

多ビートのアクションシーケンス

しゃがむ→ダッシュ→観客が反応、のように動作を順に列挙すると、モデルは選択した長さ内で多段の動きを一貫させようとします。

よくある質問

SeeVid上のGrok Imagine Video 1.5について知っておくべきこと。










今すぐGrok Imagine Video 1.5でアニメ化を始めよう

SeeVidでGrok Imagine Video 1.5を試す——テキスト/画像/参照モード、同期音声とAuroraエンジンの動き、最大1080p・15秒。