
GPT Image 2.5 对比 GPT Image 2:Token 价格相同,编辑更精细,但尚未证实
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
当OpenAI于9月8日发布GPT Image 2.5时——消费者名称为ChatGPT Images 2.5,API上则作为两个独立标识符gpt-image-2.5-flare和gpt-image-2.5-sunburst——新系列的定价与它要接替的GPT Image 2完全一致,沿用同一套token费率。这使得它成为罕见的纸面上零成本升级的图像模型:每百万图像输入token仍为8美元,每百万图像输出token仍为30美元,而OpenAI声称其细节更锐利、多轮编辑更精准,且延迟比GPT Image 2低至多50%。矛盾在于,这些说法全部是供应商自报的;在独立排行榜上,仍是由2026年4月21日推出的GPT Image 2保持着有目共睹的领先地位。这场正面对决关乎:一个同样价格却尚无法验证的承诺,是否值得今天就付诸行动;还是那个手握实证的模型,依然是更好的生产默认选择。
实际发布的是:两款型号,而非一款。
OpenAI 用两个姊妹模型取代了原来的一个 API 模型,理解这次升级首先要看这种拆分。GPT-Image-2.5 Flare 是快速默认选项——OpenAI 将其定位为面向大规模生成,并表示与 GPT Image 2 相比,它质量更高,延迟最多可降低 50%。GPT-Image-2.5 Sunburst 是精度模型,单次生成刻意更慢,瞄准“编辑精度最为重要”的编辑工作:营销创意素材、产品图像,以及任何编辑结果都必须经受住审视的内容。在消费端,此次发布在第一天就将 ChatGPT Images 2.5 带给 ChatGPT、ChatGPT Work 和 Codex 用户,并新增了 Sketch 工具、布局模板、图上评论、提示词分享等产品功能——这些功能位于聊天产品中,而非 API 中。

对于任何要与 GPT Image 2 进行对比的人来说,有两个 API 细节很重要。首先,2.5 模型在质量阶梯上新增了 xhigh 和 max——GPT Image 2 最高只到 high——并且默认值为 auto,因此文档化的参数面严格宽于上一代。其次,透明背景现在成为了一等参数:2.5 的两个标识符都接受将 background 设为 transparent、opaque 或 auto,并可输出 PNG 或 WebP。透明输出曾是 GPT Image 2 的一个痛点:它没有提供该功能,之后才增加了一个预览标志。因此,发布首日即支持透明是本次发布中较为具体的差异之一。OpenAI 还指出,2.5 的上线是增量式的——GPT Image 2 仍保留在 API 中——这对下面的决策很重要,因为没有任何因素强制迁移。
正面交锋,逐维度对比
• 发布 — GPT Image 2,2026年4月21日;GPT Image 2.5,2026年9月8日。
• API 产品阵容——一个标识符 gpt-image-2,对比两个:gpt-image-2.5-flare(快速、高吞吐量)和 gpt-image-2.5-sunburst(精准编辑)。
• Token 定价 — 相同的公开费率:图像输入每百万个 Token 8 美元,图像输出每百万个 Token 30 美元,文本输入在两者中均单独计费。
• 质量档位 — GPT Image 2 支持低、中和高;2.5 版本则新增超高和最高,并默认采用自动。
• 编辑行为——GPT Image 2 往往倾向于重新渲染:编辑可能会重建图像,从而偏离你想保留的内容。OpenAI 对 2.5 的卖点是定向编辑,只修改所请求的区域,并在连续多轮中保持一致。
• 透明背景——GPT Image 2 仅在后续的预览标志中才支持该特性;GPT Image 2.5 则自发布起就将其作为标准背景参数记录在文档中。
• 独立地位GPT Image 2 在 Artificial Analysis 的文生图竞技场中位列第一,并在图像编辑方面位列前二;两款 2.5 模型目前均未出现在任何独立排行榜上。

价格故事:相同的价目表,未知的单张图片成本
相同的token费率是这场对比中最具决策意义的事实,但需要附加一个警示。费率表并不等于每张图像的价格——每张图像的成本是费率乘以模型实际消耗的token数,而OpenAI尚未公布2.5快照版本的token消耗量或成本计算器。对于GPT Image 2,每张图像的成本是已知的,因为独立跟踪机构已对其进行测量:根据Artificial Analysis的数据,高质量1024×1024图像约为{{1}}0.21美元{{/1}},中等质量约为{{2}}0.05美元{{/2}},低质量约为{{3}}0.006美元{{/3}}。对于GPT Image 2.5,诚实的答案是,在OpenAI之外,目前还没有人知道Flare和Sunburst在给定质量设置下是高于还是低于这些数字。一个共享相同费率表但每张图像消耗更多token的模型,实际上并不是同等价格的升级,因此在投入批量使用之前,每张图像的成本是需要验证的第一件事。

价格直通正是路由层在这次特定对比中的价值所在。GPT Image 2 今天在 OrcaRouter 上以提供商列表价格提供——同样是每百万 token $8/$30,没有任何加价——所以你看到的费率表就是 OpenAI 自己的;OpenAI 改价当天,这一变化会在我们这边实时生效,无需重新协商。由于 2.5 标识符共用这套费率表,成本问题纯粹在于 token 效率,而不在于你调用哪家供应商。若要试用一个尚未经过验证的模型,路由层是安全的做法:保留一个 OpenAI 兼容端点,当 gpt-image-2.5-flare 出现在你已经调用的上游列表中时,将一小部分流量指向它,并让自动故障转移继续指向 GPT Image 2,这样即使出现坏批次,也不会拖垮整个生成队列。
延迟:两款新模型彼此不同之处。
宣传中的延迟数字——比 GPT Image 2 低最多 50%——属于 Flare,而且是 OpenAI 自己的测量结果。Sunburst 则是与之制衡的另一面:OpenAI 表示它刻意以速度换取精度,单次生成耗时更长。也就是说,真正的对比并非简单的“2.5 比 2 更快”;而是 OpenAI 将原本的单一模型拆分成了快速通道和精细通道——快速通道承载延迟承诺,精细通道承载编辑承诺。早期上线合作伙伴报告称 Flare 带来了可观的实际加速——OpenAI 选择重点展示的集成案例描述了更快的流水线和更可控的编辑效果——但这些是厂商挑选的早期客户,并非独立基准测试。在某个没有商业利益关联的第三方以相同质量设置对两个模型测量出图时间之前,请将 50% 这个数字仅视为方向性参考。
编辑才是真正的战场——而且它未经证实。
如果你了解OpenAI为什么打造2.5,就会发现整个发布都是针对GPT Image 2最受诟病的弱点:编辑会重新渲染而非精准保留。关于GPT Image 2的一再抱怨是,一个微小的修改请求就可能重建整张图片,人物或产品在多轮编辑中发生漂移,文字或背景在第二轮和第三轮处理后出现退化。2.5的发布材料恰恰瞄准了这些失败模式——保持参考照片中的主体不变,进行不影响画面其余部分的定向编辑,以及让早期修改在后续修改中存续的多轮一致性。早期集成也印证了这一说法:OpenAI重点展示的那家专注编辑的合作伙伴表示,该模型"明白什么不该动"。截至本文撰写,这些说法尚未得到任何独立评估的复现,因此GPT Image 2与GPT Image 2.5在编辑能力上的差距,目前只是一份由演示支撑的承诺,而非实测得出的结果。
基准差距与关注重点
这是在对比中GPT Image 2占绝对优势的唯一领域。GPT Image 2在独立评测平台上已是知名选手:截至2026年9月初,它在Artificial Analysis的文生图竞技场中高居榜首,在其图像编辑竞技场中也位列前两名——随着新模型不断加入,这些排名会有所波动,但它们是真实的、盲测的人类偏好得分。而GPT Image 2.5尚未出现在任何独立排行榜上。有一个值得关注的细节:8月期间,一些来源标注为OpenAI的匿名检查点以代号mona-lisa-1和luna-lisa-alpha出现在图像竞技场中,观察者认为它们与2.5系列有关。如果这些推测属实,那么9月8日发布的模型可能已在竞技场Elo中领先一步,等榜单以真实名称收录它们时便会显现出来。
具体来说,需要关注的点有三个。第一,Flare 和 Sunburst 在每个质量档位下每张图像的 token 消耗量——这决定了“同价”的说法能否经得起真实账单的检验。第二,对 Flare 与 GPT Image 2 进行独立的延迟或吞吐量对比测试,因为 50% 这个数字是这次升级最具实际吸引力的卖点。第三,Sunburst 加入图像编辑排行榜后的名次——这一结果会告诉你,OpenAI 是否真的像它宣称的那样,不仅缩小了与 GPT Image 2 的编辑差距,还追上了排名高于 GPT Image 2 的专用编辑器。
谁应该选择哪个
• 新项目、大批量生成,质量为重——从 GPT-Image-2.5 Flare 开始。它沿用 GPT Image 2 的定价标准,并增加了质量档位,理论上速度更快;在确定流水线方案之前,先与 GPT Image 2 并行运行首批任务,用你自己的图像进行对比。
• 生产环境已经在用 GPT Image 2,没有任何故障——所以没有紧迫性。此次发布是增量式的,GPT Image 2 仍然保留在列表中;而你等于是在用一个仍由供应商自行报告成绩的模型,去替换一个有独立排行榜结果的模型。等到独立评分或你自己的评测证明迁移是值得的,再做迁移,而不是在发布当天就行动。
• 必须经受住审视的编辑 — GPT-Image-2.5 Sunburst 是有意思的模型,但也是公开证据最少的那个。如果截止日期迫使你做选择,请先在具有代表性的编辑集上测试它;否则,等着看每张图片的成本和编辑排行榜的上榜情况。
• 预算敏感的低/中等质量批量任务——在 2.5 模型在这些档位上的 token 消耗量有文档记录之前,继续使用 GPT Image 2。按每张图片 0.006 至 0.05 美元计算,现有模型既便宜又可预期;而沿用相同费率表的后继模型,仍可能让成本意外走高。
归根结底,最终裁决得有一个日期为证。GPT Image 2.5 在纸面上是更好的选择——公布价格相同、质量阶梯更宽、发布首日就透明公开,编辑功能的故事线也直指 GPT Image 2 的已知弱点——但这些优势全都出自 OpenAI 之口,而 GPT Image 2 才是拥有独立实证的那一方。一句话决策:如果你能在自己的图像上做实测,现在就试用 GPT Image 2.5;否则就继续把 GPT Image 2 当作生产环境的默认项,直到排行榜和 token 计量器给出对这个新系列的独立裁决。
对于 OrcaRouter 当前路由的模型(可浏览 OrcaRouter 的模型目录),包括 openai/gpt-image-2 在内,你看到的价格均来自提供商的目录价,不加价,按原价传递。
