#ChatGPT 图像编辑升级
周生成 30 亿张:OpenAI 重构图像编辑逻辑
WooFun2026-09-09 23:50
核心要点
OpenAI发布ChatGPT Images 2.5,通过精准编辑与参考图保真技术,解决多轮修改一致性难题。API推出Flare与Sunburst双版本,生成速度提升50%,重塑商业工作流。
据 Woofun AI 消息,美国当地时间 9 月 8 日,OpenAI 正式推出最新一代图像生成模型 ChatGPT Images 2.5。此次更新并非单纯的画质迭代,而是针对生成式 AI 在后期编辑环节长期存在的痛点进行结构性重构。新版本核心聚焦于提升图片编辑的精准度、参考图的保真能力以及多轮修改过程中的视觉一致性,旨在让 AI 生成的图像从'一次性成品'转变为可反复打磨的'动态资产'。
在精准编辑与多轮修改能力方面,Images 2.5 实现了显著的技术突破。相较于前代 Images 2.0,新模型的生成速度最高提升了 50%,同时大幅优化了局部修改的稳定性。过去,用户若需修改人物服装或产品背景,往往会导致整张图像的构图或主体发生不可控的扭曲;而 Images 2.5 通过强化指令识别,能够更精准地锁定指定区域进行变更,同时保留其余部分的原始细节。OpenAI 通过一系列演示案例验证了这一能力,包括'全身编辑'与'多城市旅行票'。在'多城市旅行票'案例中,模型仅需调整票面中的单项信息,即可维持整体设计结构的完整性,这对于电商产品图、广告素材及品牌海报的制作具有极高的实用价值。
此外,针对多轮编辑场景,OpenAI 展示了'立方体旋转'、'旅行信息图'和'生日蜡烛'三个连续修改案例,证明模型能够在多次操作后依然保留前期已确定的内容,避免后续指令对已完成部分的破坏。X 用户@thesoragirls 进行的实测进一步佐证了这一点:她在图像中绘制蜡烛并指定一片花瓣保持不变,结果显示被固定的花瓣未被扰动,而其他区域则按指令正常变化。
然而,日本动画制作师@genel_ai 的测试也揭示了局限性,尽管官方强调画质保持,但在高频叠加编辑下,图像仍可能出现锯齿与质感损失,表明复杂场景下的稳定性仍有提升空间。
参考图保真与复杂场景处理能力的增强,是 Images 2.5 的另一大核心升级。用户现在可以提供人物、宠物或其他主体的照片,要求模型将其融入新场景、改变视觉风格或调整构图,新版本能更有效地保留主体的识别特征,并优化光线与纹理表现。官方提供的五个典型案例涵盖了不同维度的需求:'重新设计的婴儿肖像'与'照相亭头像'侧重人物面部特征的保持;'穿着服装的狗'测试主体换装后的形象一致性;'多人派对合成照片'涉及多个人物在同一画面中的协调;'整理床铺'则模拟日常图片编辑中对原始场景的具体调整。
这种能力对于需要连续使用同一角色、产品或品牌素材的工作流至关重要,API 用户可基于单张参考图生成多个版本,显著减少重复生成时的随机性差异。在复杂画面处理上,OpenAI 展示了极具挑战性的案例,如 20 世纪 50 年代风格的家庭插画,其中包含绿色景观、湖泊、未来建筑及巨大的圆柱形太空栖息地,模型需同时处理多层元素。
此外,宜昌旅行页面案例要求将目的地、景点信息、图片与文字整合为完整的攻略页面,考验模型对多图、多层级文字及页面布局的综合处理能力。其他案例还包括包含'Create'、'Grow together'、'Choose kindness'文字的中世纪现代主义海报、旧金山街道印象派画面、奶油金色的 Lake Como 婚礼请柬、倒置未来城市、八张美国国家公园复古邮票、太阳耀斑科普幻灯片、蓝金色地球马赛克、ChatGPT 贴纸海报以及雨夜未来城市。
这些案例覆盖了插画、海报、请柬、信息图等多种类型,证明当 Prompt 同时规定结构、文字、风格与元素时,Images 2.5 能更完整地执行指令。时尚创业者雅娜·维兰德(Yana Welinder)指出,2.5 在时尚设计上的表现明显优于旧模型,能呈现更完整的视觉效果;但 AI 与软件工程师马克·克雷奇曼(Mark Kretschmann)的森林场景测试则显示结果不稳定,他认为在部分案例中,Images 2.0 的真实感反而更佳。这表明 Images 2.5 在编辑控制与复杂指令处理上进步显著,但在不同图像类型下的真实感表现仍存在差异。
Sketch 草图与 Templates 模板功能的引入,进一步降低了创作门槛并丰富了交互方式。Sketch 功能允许用户在 ChatGPT 中直接绘制草图作为参考,模型据此生成最终图像。无论是房间布局、服装轮廓还是粗略构图,用户只需输入'@Sketch'即可调用,减少了对文字 Prompt 的依赖,尤其适用于难以用语言描述的物体位置、比例与轮廓。X 用户@fquolodasha 对 GPT-Image-2.5 的手绘能力评价极高,直言效果'有点牛',并感叹 OpenAI 近期的更新速度与能力提升迅猛。Templates 功能则针对常见创作格式提供预设模板,如 Poster 和 Merch。用户选择模板后,只需填写信息、设计元素与视觉风格,无需面对空白画布从头开始。
此外,图片分享功能新增了 Prompt 选项,用户分享图片时可附带生成该图的 Prompt,接收者可替换照片与细节继续生成。OpenAI 给出的例子是一张 20 世纪 80 年代风格的人像,包含卷发、彩色夹克、金链、霓虹灯和音乐播放器,其他用户可沿用此思路替换自有照片,实现创意复用。
在 API 策略上,OpenAI 推出了 GPT-Image-2.0.5 Flare 与 GPT-Image-2.5 Sunburst 两个版本,以满足不同开发者的需求。Flare 作为默认版本,侧重于速度、质量与编辑能力,其生成质量高于 GPT-Image-2,且延迟降低 50%,适用于社交内容、产品体验、视觉搜索、快速原型及大量图片生成场景。Sunburst 则面向需要精细控制的工作,如正式广告素材与高质量产品图片,允许更长的生成时间以换取更高的编辑精度。
这种双版本策略体现了 OpenAI 对商业化应用多样性的考量,既满足了对速度敏感的大规模生成需求,也兼顾了对精度要求极高的专业创作场景。
开发者反馈与商业工作流应用方面,Images 2.5 的更新引发了行业关注。Higgsfield AI 产品负责人阿克苏尔坦·阿利姆库洛夫(Axultan Alimkulov)特别指出,Flare 版本能较好理解哪些内容应保持不变,这对影视、UGC 和广告团队意义重大,意味着在修改单一元素时,可尽量保留原有角色、构图与视觉识别。连续创业者@gkxspace 则将此次更新置于商业图片工作流中观察,他认为过去 AI 生图的最大限制在于首张图虽好,但难以基于其稳定制作后续版本。Images 2.5 在连续编辑、速度与参考图保真上的改进,为电商换装、品牌素材延展和连续插画等场景提供了实际使用空间。
Woofun AI 整理数据显示,目前用户每周通过 ChatGPT Images 和 API 中的 GPT-Image 模型生成超过 30 亿张图片,这一庞大的基数使得任何编辑效率的提升都能转化为显著的生产力增益。
在开放范围与安全合规机制方面,Images 2.5 已向 ChatGPT、ChatGPT Work 和 Codex 用户全面开放,覆盖网页、桌面和移动端。OpenAI 同时保留了提示词和图片安全检查、C2PA 元数据以及不可见水印等机制,用于识别由其工具生成的图片。这些安全措施旨在应对生成式 AI 带来的版权与伦理挑战,确保内容来源的可追溯性。C2PA 元数据的嵌入使得图像的创作历史得以记录,不可见水印则提供了隐形的身份标识,这在日益严格的监管环境下显得尤为重要。通过将这些安全机制与强大的生成能力结合,OpenAI 试图在创新与合规之间找到平衡点,为大规模商业化应用奠定基础。
综上所述,ChatGPT Images 2.5 的发布标志着图像生成技术从'单次生成'向'可控编辑'的关键转折。尽管在真实感、细节处理及多轮编辑后的画质保持上,现有测试仍显示出不同结果,但其对编辑控制与复杂指令处理的改善已为行业带来实质性影响。随着更多实际应用的验证,Images 2.5 有望进一步重塑内容创作的工作流,推动 AI 图像生成在商业领域的深度渗透。这是继大语言模型之后,OpenAI 在多模态领域再次确立技术标杆的重要一步,其后续迭代将密切关注画质稳定性与真实感的进一步提升。
评论
暂无评论