xAI 的 Grok Imagine Video 1.5 生成带原生同步音频的电影向短片——运动更稳、对白更清晰、交互更有物理感。在 SeeVid 上支持文生 / 图生 / 参考生(最多 7 张图),时长 1–15 秒,画质 480p / 720p / 1080p。
已在 SeeVid 平台上线

Grok Imagine Video 1.5 是 xAI 的视频模型,基于 Aurora 引擎,原生同步音频。在 SeeVid 上支持文生视频、图生视频(1 张首帧)与参考生视频(2–7 张图),画质 480p / 720p / 1080p,时长 1–15 秒。
在 SeeVid 上,同一 Grok Imagine Video 1.5 覆盖三种模式:纯文案文生、单图作首帧的图生,或 2–7 张参考图混合生成;需要更高细节时可选用 1080p。
音频与视频一次生成——环境音、音效、音乐线索与简短对白会尽量贴合画面动作。相较 1.0,1.5 的对白清晰度与整体听感更好。
参数与能力围绕「让源图动起来」调优:保留视觉特征、贴近原图风格,并生成符合场景的运动,而不是仅靠文字凭空造主体。
xAI 说明相较 1.0 在人脸精度与角色一致性上有提升——适合肖像动画与角色向短片。使用真人形象时请遵守肖像权与平台规则。
Aurora 引擎视频生成:音频更清晰、真实感更强、提示词跟随更稳——支持文生 / 图生 / 参考,并受本站时长与分辨率限制。

AI 视频生成器中已对 Grok Imagine Video 1.5 开放的能力。
上传一张静图(人像、产品、插画或概念图)作为首帧,并描述运动。
将 2 到 7 张参考图混合为一条连续电影感镜头,并用提示词引导运动。
环境音、音效、音乐线索与对白随视频一并生成。可在提示词或 AUDIO: 段中引导声音。
480p 适合更快、更省的草稿;720p 适合更清晰交付;需要更高细节可选 1080p。
可选 1 到 15 秒。约 5–8 秒通常更稳;更长时长适合多节拍动作。
画幅与构图以生成器中该模型的可用设置为准;图生/参考生时输出通常贴合源图构图。
基于 xAI Aurora 引擎,短片中的重力、动量、碰撞、流体与布料类运动更可信。
可在提示词中直接写平移、倾斜、变焦、推拉、跟踪、环绕、航拍、手持与缓慢推进等。
按顺序写出动作——蹲下、再冲刺、再观众反应——模型会在所选时长内尽量保持多步连贯。
关于在 SeeVid 上使用 Grok Imagine Video 1.5 的说明。
在 SeeVid 试用 Grok Imagine Video 1.5——文生 / 图生 / 参考模式,原生同步音频与 Aurora 引擎运动,最高 1080p、最长 15 秒。