GPT-Image-2 vs Flux 3 的主视觉标题卡片,标题为“GPT-Image-2 vs Flux 3”,副标题为“一个实时模型,一张路线图”,两张卡片分别展示 GPT-Image-2(徽章:自2026年5月起提供公共API)和 Flux 3(徽章:图像层级即将推出),右下角为 OrcaRouter 标志。
Guides & Insights

GPT-Image-2 对比 Flux 3:已上线模型与路线图的比较

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这不是一个普通的模型对模型对比帖,因为GPT-Image-2Flux 3并不处于相同的存在状态。GPT-Image-2 于2026年4月21日上线,自5月初起即可通过 OpenAI 的 API 调用,本周还获得了一项新能力——API 中的透明背景图像生成,该功能于8月20日宣布,现已可用。Flux 3 是 Black Forest Labs 的多模态基础模型,于2026年7月23日宣布,但截至本文撰写时,其图像层仍然没有公共端点、没有模型 ID,也没有定价表。其中一个,你可以在凌晨3点用有效密钥调用;另一个,你只能注册进入候补名单。因此,有用的比较不是“哪个更好”,而是已发布的模型今天实际上能做什么、路线图对未发布的模型承诺了什么,以及开发者应如何看待一个不断跳票的承诺模型——而一个已上线的模型却在不断改进。

这些之中有一个有端点

先从可用性说起,因为它决定了其他一切。Black Forest Labs 于 7 月 23 日发布了 Flux 3,这是一个在图像、视频、音频和机器人动作预测上联合训练的单一模型,基于该实验室所称的 Self-Flow 流匹配方法。据报道,超过 95% 的训练算力投入到视频预测上,这一点从实际交付的产品中显而易见:只有 Flux 3 Video 于 8 月 4 日达到全面可用状态,并提供付费 API。图像层的模型页面仍然标注着“即将推出”和申请表,而不是“开始使用”按钮——没有端点、没有文档化参数、没有单张图片的成本,也没有任何人可以运行的基准测试。

相比之下,GPT-Image-2 已经投入生产四个月了。OpenAI 在五月初开放了 API 访问权限,模型的标识符 gpt-image-2 足够稳定,固定快照版本 gpt-image-2-2026-04-21 也与它并存。目前它在两大独立评测榜单上都是排名第一的文生图模型——在 Arena 的文生图排行榜(中等配置)上获得 1,381 Elo,在 Artificial Analysis 上以高端配置获得 1,369 Elo——而且它能渲染包括中日韩文字(CJK)在内的多语言文字,将生成过程建立在网络搜索之上,并支持最高 4K 分辨率的输出。四个月的生产流量,正是口头宣称与实际战绩之间的区别。

GPT-Image-2 方面的最近变更

让这场对决显得及时的事件与 Flux 3 无关。8 月 20 日,OpenAI 在 Images API 中为 GPT-Image-2 开放了透明背景预览:将背景设置为“transparent”,该端点即返回带真实 alpha 通道的 PNG 或 WebP,已抠图完毕,可直接合成。这一功能直指 Flux 3 图像路线图同样在力推的生产场景——产品图、图标、营销素材——而且它是作为参数落在已上线的端点上,而非等待新模型。因此,当全世界还在等待仍写着“即将推出”的 Flux 3 图像端点时,既有玩家刚刚填补了阻碍其进入合成管线的缺口之一。

此能力仅限 API 使用——没有 ChatGPT 开关——它是一个参数,而非新产品。Images API 的两个端点(生成和编辑)都接受一个 background 字段,其值可为 “transparent”、“opaque” 和 “auto”(默认值,由模型自行决定)。alpha 通道仅在 PNG 或 WebP 输出中得以保留,因此请求会显式固定输出格式。OpenAI 自己的 API 参考文档仍将 gpt-image-2 及其 gpt-image-2-2026-04-21 快照的透明支持标记为“预览中”——这是供应商自己的标注,并非转正公告——其建议是让提示词中不包含任何对背景的描述,这样模型才会真正响应透明请求。没有新的端点、没有新的模型 ID、也没有单独的定价表:原本返回不透明 PNG 的同一个 gpt-image-2 调用,现在将返回抠图结果。

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Flux 3 图像承诺了什么,以及实际发布了什么

Flux 3 图像层的规格表是供应商的路线图,因此就把它当作路线图看待。Black Forest Labs 承诺了跨风格与分辨率的图像合成和编辑、改进的复杂提示处理、高精度的多语言文本渲染、从参考图像进行零样本风格迁移、无需微调即可保持角色与品牌一致性,以及保留纹理和光照的非破坏性编辑。这些是值得承诺的正确事项——它们正是当前市场领导者竞争所依赖的功能——但如今它们都无法测试,因为没有一个具有端点。

从 BFL 实际可调用的包括视频层级和较早的 FLUX 图像系列。Flux 3 Video 完整渲染的价格为 HD 每秒 0.17 美元、FHD 每秒 0.29 美元,另有每秒 0.06 美元的草稿模式。其自行公布的成绩是文生视频 Elo 1135、图生视频 Elo 1051,并在偏好测试中胜过 Luma Ray 3.2、Runway Gen-4.5、Gr​ok Imagine Video 和 Kling v3 Pro——以上均为厂商自行报告且未经独立复现,而且无论如何都不适用于图像层级。在静态图像方面,BFL 目前提供的仍是 FLUX.2 系列,它在同一 Artificial Analysis 排行榜上的 Elo 为 1226,而 GPT-Image-2 以 1369 领先。这一差距正是“Flux 3 图像即将推出”的实际背景:如今 BFL 图像 API 落后 Ope​nAI 约 140 Elo,而承诺中的新模型正是 BFL 弥合这一差距所需要的。

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

定价:只存在一个真正的价格卡片。

没有 Flux 3 图像价格,因为没有 Flux 3 图像产品。唯一公布的数字是 GPT-Image-2 的 token 费率:每百万文本输入 token 5 美元,每百万图像输入 token 8 美元,每百万图像输出 token 30 美元;Batch API 约为半价,最长 24 小时周转。Ope​nAI 不公布每张图像的 token 消耗量,因此每张图像的价格是换算值而非报价:低质量 1024×1024 约 0.006 美元,中等质量约 0.05 美元,高质量约 0.21 美元,4K 高质量渲染最高约 0.41 美元。作为对比,这是账本上真实存在的一栏;Flux 3 图像那一列是空单元格。

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

构建者应如何处理承诺的模型

当竞争对手的模型不断跳票时,明智的做法是在已有基础上构建,并把未来变成一次配置变更,而不是重新架构。GPT-Image-2 如今可以通过 OrcaRouter 进行路由——一个 API 密钥、Ope​nAI 的标价以 0% 加价直接透传、跨提供商自动故障转移——因此,凡是使用它生成资产的流水线,将来在 Flux 3 image 的 API 真正存在的那一天,都可以让同一端点指向该 API,并通过路由 DSL 将一部分流量路由过去,而无需改动调用代码。你现在就能用上已发布的模型,而当承诺的模型落地时,你可以对照一个可运行的基线来评估它,而不是对照一份新闻稿。等待不会让你付出什么;但在等待中从零搭建、没有依托,才会让你付出一切。

结论的偏斜是设计使然。如果你本季度需要图像生成,GPT-Image-2 就是不二之选——它是独立榜单上的第一名,刚刚在 API 中增加了透明背景输出,而且提供公开 API 和稳定的价格。Flux 3 image 是让你关注 Black Forest Labs 的理由,而不是让你押注某个项目的理由。跟踪早期访问的开放时间和首批独立基准测试;一旦端点出现,这篇文章中的对比就会成为你真正能运行的测试。