
Ideogram 4.5 vs GPT Image 2.5:这场对决是 Ideogram 自己挑起的
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 261 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
大多数模型对比都是由写它们的人自己拼凑出来的。而这一份出自Ideogram。而Ideogram 4.5的发布页面自 2026 年 9 月 30 日起上线,页面运行着一个并排编辑演示,并在图注中点名了它的对手:“在 Ideogram 4.5 上做同样的编辑,对比 GPT Image 2.5 Sunburst、Nano Banana Pro 和 Nano Banana 2。”接着它还就观众将会看到什么下了断言——“GPT Image 和 Nano Banana 的输出在几次编辑之内就变得无法使用,而 Ideogram 4.5 则能一次编辑接一次编辑地保持干净。”
这种说法直白得有些反常。一家厂商自己选定基准测试的目标,并事先把结果告诉你——从某个角度看值得认真对待,从另一个角度看则值得抱以怀疑。GPT Image 2.5在两个图像类别的独立榜单上都是最强的存在,所以选它作为对手是选对了。而且这是一个双标识版本——Flare 和 Sunburst,均于 2026 年 9 月 8 日发布——其公开竞技场得分是目前 Ideogram 4.5 无法匹敌的。有意思的问题不在于谁能在竞技场中胜出,而在于 Ideogram 的说法是否在衡量竞技场没有衡量的东西。
两个模型各自的立场究竟如何
• Ideogram 4.5——于2026年9月30日发布。精确编辑模型;以四种渲染速度进行生成与编辑;原生2K;编辑功能在最高4,016 × 6,016(24.2 MP)的源分辨率下进行了演示。文本到图像在167个模型中位列第34,Elo为1,014 ± 11(2,247票);图像编辑位列第23,Elo为1,064 ± 11(2,382票)。按速度设置,每张图像$0.03–$0.22。
• GPT Image 2.5 Sunburst ——于 2026 年 9 月 8 日发布,是 OpenAI 拆分式图像升级中主打高精度的那一半,API 标识符为 gpt-image-2.5-sunburst。文生图 第 1 名,Elo 为 1,197 ± 9(14,023 票);图像编辑 第 1 名,Elo 为 1,182 ± 8(17,899 票)。按该榜单的换算,定价为每 1,000 张图像 210.70 美元。
• GPT Image 2.5 Flare——同一版本中速度更快的那一半,标识符为 gpt-image-2.5-flare。在两个榜单上均排名第 2:文生图 1,190 分,图像编辑 1,162 分。每 1,000 次同样为 $210.70。
把两个编辑分数并排放在一起,差距是118 Elo——1,182对1,064——置信区间分别为±8和±11。两个区间并不重叠。在衡量单次编辑偏好的榜单上,Sunburst胜出,而且它胜出时背后的投票数大约是对方的七倍半。
排行榜衡量的是什么,又不是在衡量什么
这部分决定了 Ideogram 的说法能否经得起证据的检验。
Artificial Analysis 的编辑竞技场采用盲测成对人工偏好:投票者看到同一张源图像和相同的指令,收到两个不带标签的编辑结果,然后选出更好的那个。对于“这两个输出中哪一个看起来更符合指令要求”这一问题,这是一种强有力的方法。
它无法衡量 Ideogram 所宣传的那件事。评判单次编辑的投票者看不出模型是否悄悄改动了壁纸、把某张脸挪了两毫米,或重新渲染了画面其余部分的颗粒感。Ideogram 声称要修复的那种失败,只有在整个序列中才会显现——第四轮、第七轮、第十轮——而没有任何主流竞技场会把序列呈现给投票者。1,064 的 Elo 分数说明 Ideogram 的单次编辑做得不错。但对于它们能否一直保持不错,它什么也说明不了。
这对 Ideogram 来说是把双刃剑,而诚实的说法是这样的:排行榜既没有证实“漂移”这一说法,也没有驳倒它。它确实驳倒的是读者可能从发布页上得出的那种隐含的更强主张——即 4.5 就是更好的编辑器,毋庸置疑。与该榜单相比,它是排名更低的编辑器,且落后幅度比其误差棒还要大。

各自做了什么而对方没有做的
• 源分辨率编辑——Ideogram 4.5 标志性的工程亮点。其页面展示了对一张 4,016 × 6,016 的源图直接进行编辑而无需降采样,并承诺编辑边界能保留得足够好,以便将裁剪区域重新拼回原图。对于印刷工作而言,这正是交付成果与妥协折衷之间的区别。
• 参数面的广度——这是 GPT Image 2.5 的。OpenAI 在质量等级中新增了xhigh和max,并将透明背景打造为一等参数:background 可设为 transparent、opaque 或 auto,输出格式支持 PNG 或 WebP。透明输出在 GPT Image 2 上曾是一处缺口,而在 2.5 这一对模型上则成了主打特性。
• 快速通道 — Flare 的存在就是为了成为快速的默认选择。OpenAI 声称其延迟比上一代最多可降低 50%;Sunburst 则特意放慢速度,面向那些必须经得起严格审视的编辑任务。
• 定价形态——Ideogram 按渲染速度对每张图片计费($0.03 至 $0.22)。OpenAI 则按照与 GPT Image 2 相同的费率卡按 token 计费——每百万图像输入 token $8,每百万图像输出 token $30——这正是为什么按每张图片独立换算后,一张高质量 1024 × 1024 的价格落在 $0.21 附近。
价格曲线在一个尴尬的位置相交。在 Ideogram 4.5 的 Low 和 Medium 设置下,它每张图像的价格比 OpenAI 的那一对便宜得多。在 High 档——漂移演示所在的档位,也是你会运行 2400 万像素源图的档位——两者价格接近同一个数字。大多数买家实际会做的比较,是高质量 Ideogram 4.5 对高质量 Sunburst;而在这一比较中,价格大致持平,但在实测排行榜上存在 118 Elo 的劣势。
如果漂移的说法是真的,那倒也无妨。这就是全部的赌注。


无人宣传的无障碍差异
有一个实际层面的不对称,与记分牌的方向相反。GPT Image 2.5 的两个标识符比 OrcaRouter 目录中的任何东西都新——我们今天 OpenAI 图像产品线是每百万 tokens $8/$32 的 GPT-Image-1.5,以及 $8/$30 的 GPT-Image-2,两者均按供应商标价,无任何加价提供。2.5 这对标识符以与 GPT-Image-2 相同的 $8/$30 出现在 OpenAI 的价目表上,这意味着它们一旦可被路由,就会以相同的透传价格而不是新价格落地,而它们之间的成本问题也就变成了 token 效率问题,而不是该调用哪家供应商的问题。
Ideogram 4.5 已在 Ideogram 自家的 API 和合作平台上提供。它不在我们的目录里。这对比较来说,重要性体现在一个相当乏味的方面:这两个模型里,有一个可以直接替换 OpenAI 兼容客户端,另一个则是全新的集成。如果你已经在通过 OpenAI 形式的端点调用 GPT-Image-2,那么试 Sunburst 的成本只是改一下模型 ID;而试 Ideogram 4.5 的成本,则是在你甚至还没开始评估质量之前,就已经要再多一份合同和第二个客户端。
路由层并不能消除这种差异——它只是从已经兼容的那一侧移除了管道工作,让你可以把一部分流量分给新进入者,而不必把生产路径押在它上面。在这里,故障转移比平常更重要,因为你要试用的东西是一个模型,其核心主张没有独立验证,而且样本量只有其竞争对手的五分之一。
如何解决它
不要对单张图像运行这项比较。那是竞技场的方法,而且是用错了工具——它会告诉你 Sunburst 胜出,这一点你早就知道了。
在序列上运行它。从你自己的作品中拿出五张或十张图像,编写同样一条由六到八次渐进式编辑组成的链,并在 Ideogram 4.5 (High) 和 Sunburst (max) 上执行完全相同的链。然后对每个模型,将第一轮与第八轮进行差异比较,比较那些你从未要求模型触碰的区域。数一数发生移动的像素。那个数字——跨序列的未变区域差异——正是 Ideogram 声称要取胜的指标,而据我所知,还没有人为这两个模型中的任何一个公布过它。
然后,按每条已完成的序列为两次运行分别计价。到那时,你会得到一个价值超过 118 Elo 的答案,因为它关乎的是你的图像,而不是投票小组的。
这场对决到底是什么
Ideogram 4.5 没有参加一场它在榜单上稳赢的比赛,而且它似乎也知道这一点——所以发布页面演示的是一种行为,而不是印出一个排名。它演示的这种行为足够真实,值得一测;也足够具体,可以被证伪:反复编辑要么前后一致,要么不一致,而用你自己的文件做十轮测试,一个下午就能见分晓。
如今合理的解读是:GPT Image 2.5 Sunburst 是更好的编辑器,依据是现有的唯一独立衡量标准,其优势幅度超出误差范围,且这个数字背后有远为更多的证据——而 Ideogram 4.5 推销的是一种更狭窄、未经衡量的特性,其价格在低设置下更便宜,而在其声称所依赖的设置下则大致相当。如果多轮保真度是你的生产瓶颈,那么这项测试成本很低,这个模型值得一试。如果不是,榜单早已给出了答案。
