Skip to main content
Grok Imagine Video 1.5 合作伙伴节点可从单张图像输入生成带原生音频的高质量视频。该节点由 xAI 最新的 Grok 模型驱动,可生成与音频同步的逼真运动,最高支持 1080p 分辨率。 该节点支持两种模型变体,可通过其 model 参数进行选择:
  • grok-imagine-video:上一代模型,支持可选的图像输入
  • grok-imagine-video-1.5:最新模型,必须提供输入图像,支持 1080p 输出
两种变体均生成原生音频:音效、环境音和对话在同一生成过程中合成,无需额外的音频管线。视频时长范围为 1 到 15 秒

Grok Imagine Video 1.5 的优势

  • 图生视频生成:从单张输入图像生成高质量视频
  • 原生音频:音效、环境音和对话在同一生成过程中合成,无需额外的音频管线
  • 逼真的运动:运动与已生成的音频保持同步
  • 最高 1080p 输出:1.5 模型支持 1080p 分辨率
  • 灵活的时长:视频长度从 1 秒到 15 秒

在 ComfyUI 中使用

Grok Imagine Video 1.5 工作流

在本地或 Comfy Cloud 上通过 ComfyUI 运行图生视频工作流