gpt-image-2) 是 OpenAI 最新的图像模型,现已通过合作节点 (Partner Nodes) 在 ComfyUI 中可用。它是 OpenAI 第一个在生成之前会进行推理的图像模型:它不会一次性采样,而是先规划画面构图,检查结果,并进行迭代。
此节点支持:
- 文生图,能够出色处理密集文字、UI 元素、图标、信息图、地图、幻灯片和漫画分镜
- 图像编辑,在最高 2K 分辨率下保持高结构保真度
- 根据单个提示词最多生成 8 张一致的图像,同时保持角色和物体的连续性
model 选项提供。此节点会同步调用 OpenAI 的图像生成 API,并返回与描述匹配的图像。
GPT-Image-2 擅长什么
推理驱动的生成
GPT-Image-2 会在渲染之前规划构图。这使得它非常适合那些历来难倒图像模型的提示词:例如,一张使用 11pt Helvetica 居中排列七项项目符号列表的海报;它还能为密集文本、小型 UI 元素、图标、信息图、地图和幻灯片输出清晰的结果。保留关键内容的图像编辑
GPT-Image-2 能以结构保真度处理局部编辑,在保持编辑区域之外的像素稳定不变的同时,以最高 2K 分辨率干净地应用所需的更改。可用于为黑白照片着色或将场景从正午变换到黄昏等使用例,而不会扭曲面部、几何形状或精细细节。每个提示词最多生成八张一致的图像
该模型能从单个提示词返回最多八张不同的图像,同时保持角色和物体在整个系列中的连续性。这适用于故事板、参考图、角色转身图和产品变体,无需固定种子或精心编排提示词。可直接将批处理送入保存图像 节点,或将其链接到下游的视频工作流中。
混合 Pipeline
GPT-Image-2 可以自然嵌入到混合 Pipeline 中:用它生成包含大量文字的关键画面,然后交给本地模型进行图像放大、风格化或视频生成:在同一个工作流中,每个步骤都用最合适的模型。示例输出
基于推理驱动的构图进行文生图生成:
在输入图像上进行图像编辑,保留编辑区域之外的结构:
在 ComfyUI 中使用
GPT-Image-2 工作流
在 ComfyUI 中本地或通过 Comfy Cloud 运行文生图和图像编辑工作流