ChatGPT Images 2.5 发布

OpenAI 今天正式发布 ChatGPT Images 2.5,这是其最新的图像生成模型,覆盖 ChatGPT 与 API 两个入口。官方给出一个规模数据:目前每周通过 ChatGPT Images 和 API 中的 GPT-Image 模型生成的图像超过 30亿张。相比 Images 2.0,Images 2.5 的生成延迟最高降低 50%

在画质上,新模型生成更自然的光照、更丰富的纹理,处理参考照片时能更好保留主体特征;在编辑上,它更擅长只修改用户指定的局部,同时保持背景和其他细节不变;在多轮对话中,它能更稳定地遵循连续的编辑指令,前次修改不会在后续编辑中被破坏。这些改进同时服务于普通用户和 API 开发者。

ChatGPT 端新增了几项控制创作流程的功能。Sketch 允许用户直接在 ChatGPT 里画草图,然后以草图为视觉参考生成最终图像,输入 @Sketch 即可使用。Templates 提供海报、商品图等常见格式的起点模板。用户还可以直接在图像上添加评论,把编辑意图落在具体位置;分享图片时也能附带提示词,让别人用自己的照片和细节复用同一套想法。

API 端推出两个新模型。GPT-Image-2.5 Flare 与 ChatGPT 端的 Images 2.5 共享质量、编辑和速度改进,是大多数应用的默认选择,官方称其比 GPT-Image-2 延迟低 50%,适合创作者内容、社交内容、产品体验、视觉搜索、快速原型和高批量生成。GPT-Image-2.5 Sunburst 面向更精细的创意工作流,在编辑控制上更紧,但生成时间更长,适合制作级活动素材和精致产品图。

图像真实感方面,官方强调模型在基于参考照片的生成中表现更好。对于用 API 做开发的团队,这意味着以参考为主导的工作流更可靠,生成结果能更稳定地锚定原始素材。精准编辑方面,开发者可以让用户只更新某个元素(如产品、背景或文案),而保留主体、构图和品牌风格不变。

多轮编辑一致性对生产环境同样重要。官方表示,在进行连续修改时,模型能够保持先前改动的一致性,每次新编辑都建立在已有成果之上,不会让图片质量逐轮退化。对需要在不重建整个素材的情况下做定向修改的开发者来说,这一点可以降低返工成本。

智能与风格层面,Images 2.5 能理解更复杂的视觉指令,包含真实世界信息的图像内容更准确;支持更复杂的布局,包括透明背景;在还原指定视觉风格上也更贴合作者的艺术意图。官方称,这能让复杂创意简报的交付更稳定,避免在指令越来越具体时出现风格漂移。

安全方面,Images 2.5 建立在既有防护基础上,对输入提示词和输出图像都做检查,并继续使用 C2PA 元数据和隐形水印来标记 AI 生成内容。模型今天起向所有 ChatGPT、ChatGPT Work 和 Codex 用户在桌面、移动端和网页端推送;API 中的 Flare 和 Sunburst 模型也已可用,具体价格需查阅官方定价页。

Introducing ChatGPT Images 2.5

查看原文