Photoshop 级的精准图像编辑能力
定向改图、连续微调、参考照片换装与合照,再到草图、模板和提示词:看看 Images 2.5 能怎样融入创作。
OpenAI 发布了其最新的图像生成模型 GPT Images 2.5,该模型最大的更新是提升了 AI 修图的三个关键能力:更准确地修改指定位置,更好地保留参考照片中的人物与物体,以及在连续修改时延续前面已完成的调整。GPT Images 2.0 已经支持图像生成与编辑,但 2.5 进一步改善的是修改的精度和一致性。
GPT Images 2.5 的核心功能特点包括:
定向调整指定位置,在连续修改中更好地延续已有结果。
更好地保留参考照片中的主体特征,呈现更自然的光照和更丰富的纹理。
更准确地理解视觉要求,组织复杂版式,改善包含现实世界信息的图像内容。
更好地遵循指定的艺术风格,并支持透明背景输出。
GPT Images 2.5 图像生成延迟相比 2.0 最多降低 50%。还增加了草图、预置模板、图片批注和提示词分享;API 则提供了速度优先的 GPT Images 2.5 Flare 与质量优先的 GPT Images 2.5 Sunburst 两个版本。
定向编辑:
改指定位置,保留周围内容
在 AI 修图过程中,定向编辑(Precision Editing)的核心在于实现局部受控调整:更准确地修改指令指定的元素,并尽量保留周围人物、背景、光照和品牌风格。每次编辑得到一张修改后的图片;把不同轮次的结果连续播放,就能看到变化过程。
在手持倾斜构图和票根版式相近的情况下,依次定向替换票面上的城市名称与代表景观。例如将新德里印度门切换为圣保罗斜拉桥都市、东京樱花寺塔、巴黎埃菲尔铁塔及旧金山金门大桥,展示了卡片特定局部图文的精准置换能力。
以同一位站立女性的全身正面照片作为基底,分别执行多项独立的局部改动:更换淡紫色缎面上衣、替换为陶土庭院背景、佩戴藏青色贝雷帽、转换为水粉画风,或调整为强烈的午后直射光与投影。在各项独立修改中,人物姿态、身材比例与核心五官特征均与基底保持相近。
多轮编辑:
让新的调整延续已有结果
多轮编辑一致性(Multi-turn Editing Consistency)指的是:连续修改一张图时,新的要求更好地延续上一步的结果,减少先前改动丢失或画面质量下降。比如先改标题,再调整行程,最后删除一个模块,让一张图逐步接近需要的版本。
面对包含多区域排版与中文文本的信息图表,连续执行 5 步定向改版:
在立方体多角度旋转变换中,立方体随角度变化呈现不同侧面,连续观察其几何结构和透视关系。
在树桩造型的巧克力长条蛋糕上,细蜡烛从左至右逐根点燃。在烛火逐步增加的整个过程中,长条蛋糕的树皮纹理、淋面光泽、桌面小蘑菇与右侧绿色青蛙立体装饰整体构图保持相近。
参考照片:
换装、合照与整理房间
上传人物、宠物或房间照片后,可以在这些照片的基础上换装、组合场景或改变画风。2.5 更能保留主体的辨识度,并让光照和质感更自然。
输入一张手持儿童纸质照片的现实抓拍,在纸质照片内部将儿童的红色上衣替换为米白色西服配黑领结,外部持握照片的手指、倾斜角度与周围环境保持相近。
浅色卷毛小狗站在日照露台黑色桌椅旁,换上一套印有“STUNTMAN”字样并配有红蓝星条头盔的特技服,小狗自身外貌特征与露台背景、地面长投影保持协调。
输入一张斜顶卧室中被褥散乱的真实照片,输出图将床单被褥铺平、枕头排列规整,保留了床品的自然褶皱质感,同时斜顶天花板、窗户、台灯与床头柜的空间布局保持相近。
输入手持带有反光、相纸边缘及底部标签的抓拍快照,输出图去除了持握手指与反光遮挡,提取出干净的正身肖像,保留了紫红上衣和身后的绿门背景。
输入三位男士在不同光照环境下的独立单人照片,融合成一张三人在室内派对并肩站立、手持红色水杯的聚会合影。
智能与风格理解:
从复杂版式到系列物料
Images 2.5 增强了对复杂视觉指令的解析能力,在处理真实世界信息时更加准确,更能遵循特定艺术风格与版式要求,并支持原生透明背景输出。
复古未来主义(retrofuturism):一家三口隔窗眺望巨大的太空圆柱居住体,呈现古典科幻宣传画风格;
印象派城市风光(impressionist-cityscape):利用厚涂彩色笔触表现海湾、斜坡街道与红色跨海大桥;
科幻超现实主义(sci-fi-surrealism):倒悬的城市建筑、夜空横向悬浮的人物与弧形地平线;
婚礼邀请函(wedding-invitation):奶油金典雅边框、对称徽章与手写字体排版;
马赛克拼贴(mosaic):蓝金马赛克瓷砖缝隙拼出地球与星系;
贴纸海报(stickers):复古质感海报中黑猫捧着贴纸页;
赛博朋克都市(cyberpunk):冷蓝雨夜高楼、巨型发光广告屏与空中悬浮飞行器。
ChatGPT 交互功能升级:
四个实用创作工具
除了模型本身画质与一致性的提升,客户端增加了四个降低操作门槛、提升控制精度的交互工具:
空间布局或服装线条往往难以用纯文字完全描绘。在输入框输入 @Sketch 可调出画板,直接手绘房间走线、服饰轮廓或粗略构图作为视觉指引(visual guide),配合风格描述文字生成完整成品。
为海报(Poster)、宣传单(Flyer)、周边商品(Merch)等热门创作格式提供起点,免去面对空白画布的困扰,用户只需填入文字信息与风格需求即可快速成型。
无需在对话框中用文字繁复说明修改方位,用户可以直接在生成图片的目标位置放置评论,发起针对局部的聚焦修改。
分享图片时可同步附带生成该图所用的完整提示词,接收者可以直接套用这套构图与风格方案,并置换入自己的照片或细节(例如流行的 80 年代复古写真风格)。
API 双轨选型与精准提示词(Prompting)实战
根据画质要求与等待时间,API 提供两款模型:
Flare:优先速度
GPT-Image-2.5 Flare 是较小的模型,图像质量与 GPT Image 2 相当,延迟相比 2.0 降低最多 50%。适合社交内容、产品 UI 原型、视觉搜索和高并发批量生成。
Sunburst:优先画质
GPT-Image-2.5 Sunburst 是基础模型,图像品质高于 GPT Image 2,跨轮编辑控制更精细,生成耗时相对更长。适合品牌视觉、广告物料和精修电商展示图。
GPT-Image-2.5 也已接入 Adobe Firefly,可以与其中的专业设计工具结合,完成从构思到成品的创作。
API 参数怎么设置
尺寸、质量和背景格式通过 API 参数设置;提示词负责描述画面内容。
选择 gpt-image-2.5-flare 或 gpt-image-2.5-sunburst。
支持 auto(默认)、low、medium、high、xhigh、max。
图表小字或密集排版可尝试 high;有更细致的画面要求、且能接受更长等待时,再测试 xhigh 或 max。更高档位不保证每次都得到更好的结果。
常用规格包括 1024x1024、1536x1024、1024x1536。自定义尺寸需满足:
总像素超过 3,686,400(2560×1440)属于实验性支持。
支持 auto、opaque(不透明)和 transparent(透明)。
透明背景使用 background="transparent",输出格式选 PNG 或 WebP。PNG 不使用 output_compression;WebP 可以设置压缩率。
提示词怎么写
写清目标、参考图的用途,以及哪些内容需要改变、哪些需要保留。更多场景可查阅 GPT Image 2.5 提示指南。
(Assign roles to references)
当输入多张参考图时,在提示词中分别指定图像编号与用途(例如“图 1 为主体人物”、“图 2 为目标服饰”),说明元素组合逻辑。
(Separate changes from constraints)
明确使用“仅修改 X(change only X)”,并逐项列出必须锁定的要素(如人物五官、表情、发型、体态、背景构图、相机视角与光照色温)。
(Verbatim text in quotes)
把需要出现的文案原样放入引号,指定出现次数(如“render exactly once”)与排版位置,并显式要求不添加多余文字。
(Refine across turns)
将上一轮生成的图片作为下一轮请求的输入基底,单次只微调一个局部属性,确认无误后再推进下一项,便于发现并修正意外改动。
换装提示词:把修改项与保留项分开
API 请求参数单独设置,例如 model="gpt-image-2.5-flare"、quality="medium"、size="1024x1536"。提示词可以写成:
仅替换服装:让图 1 中的人物穿上图 2 的衣服。
保留人物的脸、肤色、发型、体型、姿态和表情。
保留图 1 的背景、相机角度、光照方向和整体构图。
让服装贴合现有姿态,布料褶皱与接触阴影自然。
不添加文字、标志或水印。
API 计费标准与成本构成
Standard(标准)模式按 token 用量计费,计费单位为美元 / 100 万 token($ / 1M tokens)。
在 GPT-Image-2.5 Flare、GPT-Image-2.5 Sunburst 与上一代 GPT-Image-2 之间,基础 Token 单价保持完全一致:
三款模型的对应单价相比 2.0 均未改变。价格核对日期:2026 年 9 月 9 日。查看当前价格。
单张图片的费用怎么算
一次请求的费用,是文本输入、图像输入和图像输出三部分费用相加。每部分按实际使用的 token 数量,乘以上表对应单价,再除以 100 万。
按文本 token 数计费。
数量和尺寸会影响图像输入 token 用量;命中缓存的部分按缓存输入价计费。
输出尺寸和 quality 档位会影响图像输出 token 用量,最终费用以实际用量为准。
发布时间、可用范围与安全机制
2026 年 9 月 8 日起,逐步面向 ChatGPT、ChatGPT Work 以及 Codex 的所有层级用户开放,覆盖桌面客户端、移动端与 Web 网页端。
开发者已可在 API 中调用 gpt-image-2.5-flare 与 gpt-image-2.5-sunburst。
可编辑提示词模板
中文长图与海报多轮精准微调实战模板
第一阶段:建立基底图(定义全局风格与版式)
【主题】城市周末旅行攻略(以杭州为例)。
【版式结构】
- 顶部:醒目中文大标题《杭州漫游》,右上角标注“2天1夜”。
- 中部:分为上下两个矩形卡片,上卡片为“第一天:西湖与茶园”,下卡片为“第二天:运河与古街”。
- 底部:纯色卡片标注“出行建议:公共交通优先”。
【视觉风格】扁平插画风,清新薄荷绿与暖木配色,高对比度排版,留白充裕。
第二阶段:局部文字与模块微调(明确要改和要保留的内容)
保持当前海报的整体配色、插画构图与留白完全不变,仅做以下局部文字替换:
1. 将顶部大标题《杭州漫游》修改为《杭州漫游指南》;
2. 将右上角“2天1夜”修改为“周末48小时特辑”;
3. 不要改动中间和底部的任何插画与文字。
第三阶段:模块增删与版块重整(测试留白重构能力)
保持上方所有标题与第一天、第二天的内容原封不动:
1. 移除底部“出行建议:公共交通优先”的整块纯色卡片;
2. 该区域转换为干净的自然留白,海报底边保持整洁。
每轮结果核对
现实照片主体锚定与环境/服装置换模板
提示词结构:
【核心任务】基于上传照片中的主体,进行局部特征重塑。
【必须保留的特征(锁定锚点)】
- 主体的五官比例、面部朝向、身形体态完全保持原样;
- 眼神视线与头部倾斜角度保持不变;
- 保持照片原本的真实拍摄质感,避免塑料磨皮假感。
【变更要素(定向修改)】
- [服装/道具]:将原本的便服替换为[具体描述,如“复古宇航员太空服,带有精致铜制拉链和徽章” / “定制版复古羊毛毛衣”];
- [场景/光影]:背景平滑过渡为[具体描述,如“阳光柔和的北欧风木质阳台,背景虚化”];
- 确保新添加的衣物与身体轮廓贴合自然,边缘受光与环境主光源方向保持一致。