Skip to main content
Gemini Omni Flash 是 Google DeepMind 推出的高质量、经济高效的视频生成与对话式编辑模型。该模型作为 Gemini Omni 家族成员在 Google I/O 2026 上首次亮相,将 Gemini 的多模态推理能力与原生视频创建功能相结合,使开发者能够通过自然对话生成、编辑和重新混合视频。

Gemini Omni Flash 擅长什么

  • 对话式视频编辑:使用自然语言完善和编辑视频:替换角色、重新布光、改变角度、添加或移除物体,同时保留原始音频和视频轨道
  • 多模态输入:组合文本、图像和视频输入来引导生成。每次输出视频时原生生成同步音频
  • 世界知识与模拟:将物理理解与 Gemini 在历史、科学及文化背景方面的知识相结合,实现超越照片真实感的有意义叙事
  • 文本与动作同步:直接在视频中渲染清晰易读的文本和图形,使动态排版与屏幕上的运动同步
  • 定价:视频输出每秒 $0.10,与 Veo 3.1 Fast 定价一致

在 ComfyUI 中使用

Gemini Omni Flash 工作流

在本地或 Comfy Cloud 上,通过 ComfyUI 运行文生视频、图生视频和视频编辑工作流