OpenAI 的 gpt-image-2 是 gpt-image 系列的新一代模型——通过标准 OpenAI Images API 访问、按 token 计费的图像模型。它是 gpt-image-1 的直接升级:相同的 SDK,相同的调用格式,相同的参数。只需将你现有的 OpenAI 客户端指向 OrcaRouter 的 base URL,并将模型设为 `openai/gpt-image-2` 即可。定价为每 100 万 token 输入 $5.00 / 输出 $30.00,按成本计费——零加价,零迁移。
OpenAI GPT-Image-2 是 OpenAI 推出的一款专注于图像生成与编辑的多模态模型。它接收文本提示和可选的图像输入,生成修改后或全新的视觉输出。该模型的性能通过 LM Arena 图像编辑 Elo 评分衡量,得分为 1467.0,在该基准测试中位列图像编辑任务的前列。GPT-Image-2 可通过 OrcaRouter 的 API 使用,该 API 作为底层 OpenAI…
GPT-Image-2 专为根据文本描述生成图像及基于文本指令编辑图像而设计。它能够修改颜色、纹理、形状和构图等属性,同时支持添加或删除对象。该模型通过提示设计隐式实现了内补(替换图像部分区域)和外补(扩展画布)功能。此外,它还支持风格迁移,让用户能够将特定美学效果应用于源图像。这些能力使其适用于从简单修正到创意视觉实验的多种任务。
是的,GPT-Image-2 可以根据文本提示生成全新的图像,无需输入任何图片。该模型利用提供的描述来构建视觉呈现,包含场景构图、光照、颜色和物体等细节。生成图像的质量和逼真度取决于提示词的明确程度以及底层架构的限制。为获得最佳效果,提示词应清晰无误,避免模糊表述。这一功能适用于创意构思、原型设计以及根据概念描述生成独特插图。
GPT-Image-2 接受文本提示作为主要输入。在编辑图像时,需要提供现有图像,可以是URL形式或API请求中的原始base64编码数据。图像应为标准格式如PNG或JPEG,分辨率和大小限制由OpenAI的API规范决定。该模型原生不支持视频或多图像输入;每个请求仅针对一个提示-图像对。输出图像以常见格式生成,通常为PNG格式,可根据客户端偏好以URL或base64数据形式提供。
GPT-Image-2 不会在请求之间保持状态;每次 API 调用都是独立的。多步编辑——即通过一系列提示逐步优化图像——必须由调用方应用程序来管理。开发者可以实现一个工作流,让每一步都将前一步的输出作为下一个请求的输入。这种方法可以实现迭代编辑,例如先调整颜色,然后添加背景,再调整大小。虽然功能可用,但缺乏内置状态意味着应用程序必须处理上下文,例如存储中间图像并为每一步构建合适的提示。
LM Arena 图像编辑 Elo 评分 1467.0 是一项衡量图像编辑输出质量的基准测试。在此背景下,Elo 评分基于人类评估者对模型输出进行成对比较计算得出。1467 分表明 GPT-Image-2 显著优于基线模型,并与其他领先的图像编辑模型具有竞争力。它反映在物体插入、背景替换、颜色更改和构图编辑等任务上的强劲表现。该评分是 LM Arena 排行榜上图像编辑类别中的最高分之一,表明该模型产生的编辑结果连贯、忠于提示且视觉上令人赏心悦目。
GPT-Image-2 的延迟取决于提示词的复杂度、输入(如有)的大小以及期望的输出分辨率。OpenAI 未公开该模型的固定延迟保证;典型响应时间从几秒到数十秒不等(针对大尺寸图像或复杂编辑)。由于 OrcaRouter 是一个中继服务,不会增加提供商处理时间,因此实际等待时间与直接调用 OpenAI 相同。对于生产环境的应用,用户应实现超时与重试逻辑,并考虑使用批处理来管理吞吐量。
GPT-Image-2 在需要依据自然语言指令进行精确修改的图像编辑任务中表现出色。其高 LM Arena Elo 分数反映了其生成的编辑既准确又美观。该模型能良好处理复杂的构图变化,例如替换物体同时保持适当的光影效果。它还能从零生成高质量图像,具备出色的真实感和遵循提示的能力。用户普遍反映,它能够通过合理的风格迁移,很好地处理创意指令(例如“让这个场景看起来像油画”)。
尽管GPT-Image-2在基准测试中表现出色,但仍存在局限性。它可能难以处理非常长或多步骤的指令,特别是当多个对象需要同时修改时。该模型可能会产生偶发的伪影,例如扭曲的面部或不够真实的纹理,尤其出现在复杂场景中。同时,模型的安全限制会阻止生成某些类型的内容,这可能限制部分创意用途。此外,由于模型通过OpenAI的基础设施访问,用户需遵守OpenAI的内容政策和速率限制,这可能会影响批量编辑的工作流程。
GPT-Image-2 按 token 计费:每百万输入 token 收费 8.00 美元,每百万输出 token 收费 30.00 美元。输入 token 包括文本提示和编码为 base64 的图像数据(因为图像会被 token 化)。输出 token 是生成的图像表示。请求的总成本取决于提示的长度以及输入和输出图像的分辨率。OrcaRouter 以零加价传递此定价,即成本与 OpenAI 收取的费用完全一致。OrcaRouter 平台不添加任何额外费用。
不。OrcaRouter明确声明,它按提供商费率对GPT-Image-2进行计费,且不加价。这意味着每token的价格正好是输入$8.00、输出$30.00。OrcaRouter不会收取任何月费、基础费用或加价百分比。用户仅需承担OpenAI消耗的token费用。用户应确保在OrcaRouter上设置有效的计费方式,以避免服务中断,但计价公式透明且可预测。
OpenAI 并未公开提供图像生成或编辑提示的缓存功能;每个请求都是独立处理的。因此,重复使用相同的输入图像和相同提示时,每次调用通常都会产生完整的令牌费用。不过,如果你的应用程序频繁使用同一输入图像,你可以将图像存储在外部并通过 URL 引用(如果支持的话),而不是将其重新编码为 base64,从而减少输入令牌的使用。OrcaRouter 不提供任何额外的缓存层来减少此模型的令牌消耗。
GPT-Image-2 的定价由 OpenAI 设定,因其专业编辑能力,在图像模型中属于成本较高的选项。更便宜的替代方案(如 OrcaRouter 上的 Stability AI 模型)可能提供更低的每 token 费用,但在 LM Arena 基准测试中,其编辑精度可能不及前者。取舍在于成本与输出质量之间。对于简单编辑或低风险应用,价格较低的模型可能已足够;而当高保真度和指令遵循度至关重要时,GPT-Image-2 则是更优选择。
要使用 GPT-Image-2 通过 OrcaRouter,请向兼容 OpenAI 的端点 https://api.orcarouter.ai/v1/images/generations(或根据操作使用类似端点)发送 HTTP POST 请求。将模型参数设为 "openai/gpt-image-2"。包含一个提示字符串,并可选地附上一张图片(以 base64 或 URL 形式)用于编辑任务。OrcaRouter 使用您的 API 密钥进行身份验证(通常通过 Authorization 头传递,格式为 "Bearer <key>")。响应将包含所请求格式的生成图像数据,通常为 URL 或 base64 字符串。
API 参数大体遵循 OpenAI 的图像生成架构。关键参数包括 "model"(设置为 "openai/gpt-image-2")、"prompt"(文本指令)、"n"(生成图像数量,默认为 1)、"size"(输出尺寸,如 "1024x1024")、"response_format"("url" 或 "b64_json")以及 "user"(用于速率限制追踪)。对于编辑任务,还可以包含 "image"(输入图像的 base64 编码)和 "mask"(用于局部重绘,指定需要修改的区域)。完整支持的参数及其约束请参考 OpenAI 官方文档。
迁移非常简单,因为 OrcaRouter 提供完全兼容 OpenAI 的 API。只需将基础 URL 从 https://api.openai.com 更新为 https://api.orcarouter.ai/v1,并将模型字符串(例如 "gpt-image-2")修改为 "openai/gpt-image-2"。现有的身份验证、请求序列化和响应处理代码无需任何修改即可正常工作。无需更改参数名称或数据结构。更新端点和模型 ID 后,通过一次请求测试以确认连接和计费行为。
OrcaRouter 使用 API 密钥进行身份验证。您必须在请求标头中包含您的 OrcaRouter API 密钥。速率限制由 OrcaRouter 和 OpenAI 共同决定。OrcaRouter 可能会施加限制以防止滥用,但这些限制通常比较宽松。OpenAI 会根据层级和计费方式应用自身的速率限制,无论您是通过 OrcaRouter 还是直接访问模型,这些限制均适用。用户应通过 OrcaRouter 仪表盘监控使用情况,并相应调整请求频率。除 API 密钥外,无需额外的身份验证。
GPT-Image-2 和 DALL-E 3 都是 OpenAI 的图像生成模型,但针对不同的使用场景。DALL-E 3 是一个通用型文本到图像模型,专注于从零开始生成创意和逼真的图像。GPT-Image-2 则针对编辑现有图像进行了优化,其高 LM Arena Image Edit Elo 分数证明了这一点。尽管 DALL-E 3 也能执行一些编辑操作,但其优势在于原始生成。GPT-Image-2 倾向于对输入图像进行更精准的修改,尤其是在提示词要求保留原始构图元素时。
Stability AI模型如SD3.5是开源图像生成器,每个token成本较低,但可能需要更多的提示工程才能达到类似质量。GPT-Image-2作为专有模型,受益于大量训练数据和微调,适用于编辑任务,这在其LM Arena评分中有所体现。两者之间的选择取决于预算和质量要求。对于精度要求高的高风险编辑,GPT-Image-2更可取。对于批量生成或成本为主要考虑因素时,OrcaRouter上可用的Stability AI模型可能是一个可行的替代方案,但您必须针对特定应用评估质量差异。
当您的任务仅涉及简单的图像生成且无需编辑要求,或对不完美编辑的容忍度较高时,请选择更便宜的模型。例如,生成占位图像、简单图标或低分辨率图形可能不需要GPT-Image-2的复杂性。同样,如果您的提示仅涉及微调(例如调整亮度或裁剪),则功能较简单的模型可能就足够了。OrcaRouter提供多种价格区间的图像模型。请评估您的具体使用场景——如果编辑任务复杂且要求高保真度,则使用GPT-Image-2是合理的;否则,请考虑通过替代模型节省成本。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1| 输入 / 1M tokens | $8.00 |
|---|---|
| 输出 / 1M tokens | $30.00 |
| 缓存读取 / 1M | $1.25 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2