Skip to main content
OpenAI GPT-Image-2 (gpt-image-2) 是 OpenAI 最新的图像模型,现已通过合作节点 (Partner Nodes) 在 ComfyUI 中可用。它是 OpenAI 第一个在生成之前会进行推理的图像模型:它不会一次性采样,而是先规划画面构图,检查结果,并进行迭代。 此节点支持:
  • 文生图,能够出色处理密集文字、UI 元素、图标、信息图、地图、幻灯片和漫画分镜
  • 图像编辑,在最高 2K 分辨率下保持高结构保真度
  • 根据单个提示词最多生成 8 张一致的图像,同时保持角色和物体的连续性
在节点库中,GPT-Image-2 作为 OpenAI GPT Image 1.5 节点上的 model 选项提供。此节点会同步调用 OpenAI 的图像生成 API,并返回与描述匹配的图像。

GPT-Image-2 擅长什么

推理驱动的生成

GPT-Image-2 会在渲染之前规划构图。这使得它非常适合那些历来难倒图像模型的提示词:例如,一张使用 11pt Helvetica 居中排列七项项目符号列表的海报;它还能为密集文本、小型 UI 元素、图标、信息图、地图和幻灯片输出清晰的结果。

保留关键内容的图像编辑

GPT-Image-2 能以结构保真度处理局部编辑,在保持编辑区域之外的像素稳定不变的同时,以最高 2K 分辨率干净地应用所需的更改。可用于为黑白照片着色或将场景从正午变换到黄昏等使用例,而不会扭曲面部、几何形状或精细细节。

每个提示词最多生成八张一致的图像

该模型能从单个提示词返回最多八张不同的图像,同时保持角色和物体在整个系列中的连续性。这适用于故事板、参考图、角色转身图和产品变体,无需固定种子或精心编排提示词。可直接将批处理送入 保存图像 节点,或将其链接到下游的视频工作流中。 GPT-Image-2 一致的图像示例

混合 Pipeline

GPT-Image-2 可以自然嵌入到混合 Pipeline 中:用它生成包含大量文字的关键画面,然后交给本地模型进行图像放大、风格化或视频生成:在同一个工作流中,每个步骤都用最合适的模型。

示例输出

基于推理驱动的构图进行文生图生成: GPT-Image-2 文生图示例 在输入图像上进行图像编辑,保留编辑区域之外的结构: GPT-Image-2 图生图示例 GPT-Image-2 图像编辑示例 1

在 ComfyUI 中使用

GPT-Image-2 工作流

在 ComfyUI 中本地或通过 Comfy Cloud 运行文生图和图像编辑工作流