OpenAI的GPT-Image 1.5用于文本和图像输入,通过OrcaRouter的API以provider-direct定价访问。
openai/gpt-image-1.5是OpenAI开发的多模态模型,可同时接受文本和图像输入。它专为需要结合自然语言理解视觉内容的推理任务而设计。通过OrcaRouter兼容OpenAI的API访问,模型标识符为'openai/gpt-image-1.5'。提供商定价无额外标记:输入令牌每百万8.00美元,输出令牌每百万32.00美元。该模型非常适合涉及图像分析、图像标注和视觉问答的用例。
该模型能够理解并结合图像与文本指令进行推理。常见任务包括为照片生成描述性标题、回答关于图像内容的问题(例如“汽车是什么颜色?”),以及从图像中提取文本(在适当提示下执行类似OCR的任务)。它还可用于更复杂的推理,例如分析图表、示意图或手写笔记。具体能力范围取决于模型的训练情况——OpenAI尚未详细说明——但该模型遵循通用的多模态转换器范式。
该模型在视觉上下文对生成准确文本输出至关重要的场景中表现出色。示例用例包括为视障用户提供实时描述、根据目录图像自动标记产品,以及通过生成初步报告辅助医学影像分析。它也适用于教育应用,如解释图表或解决视觉谜题。由于这是一种专门的图像-文本模型,它可能在纯图像到文本任务上优于通用多模态模型,尽管提供商未提供直接对比。
如果您的应用不需要图像输入,则应考虑使用OrcaRouter上可用的更便宜的纯文本模型,例如openai/gpt-4o-mini,它每token成本较低。同样,如果您的图像任务简单(例如二分类)且可以由轻量级视觉模型处理,则较小的替代方案可能更具成本效益。GPT-Image 1.5定价在OpenAI产品中属于较高端,因此对于高容量、低复杂度的图像任务,评估较小的模型是否能满足您的准确性要求是值得的。OrcaRouter允许您在同一任务上测试多个模型,以比较成本和质量。
该模型需要同时输入文本和图像才能生成输出。实际操作中,您可以使用诸如“描述这张图片”之类的极简文本提示,即可单独处理图像。不过,模型的架构始终要求消息中包含文本部分,不存在纯图像推理模式。图像被视为对话上下文的一部分,因此您也可以进行多次图文交替的对话。目前没有公开信息表明该模型是否支持视频输入或动画帧。
截至知识截止日期,OpenAI 尚未公布 GPT-Image 1.5 模型的任何基准测试分数。这对于可能仅供内部或早期访问使用的专用模型变体来说很常见。由于缺乏官方基准,无法与其他多模态模型进行定量比较。建议用户自行使用数据集评估该模型,以判断其在特定任务中的有效性。OrcaRouter 的平台提供日志记录和分析功能,可协助此类评估。
openai/gpt-image-1.5 的延迟详情尚未公开。通常,处理图像输入的速度会慢于纯文本请求,因为模型在生成文本前必须先对视觉信息进行编码。实际响应时间取决于图像大小、请求复杂度和当前API负载等因素。OrcaRouter的API包含可配置的标准超时设置,用户应使用自己的图像尺寸测试模型,以评估实际性能。该模型目前没有公开的速度基准测试。
GPT-Image 1.5 的主要优势在于它能够将视觉信息整合到语言模型的推理过程中,从而处理纯文本模型无法完成的任务。其局限性在于缺乏公开可用的性能数据,使得在没有实证测试的情况下难以预测准确性。此外,与专门的计算机视觉模型相比,该模型可能不太适合需要高分辨率图像细节的任务(例如极小文本的精细OCR)。与所有大型语言模型一样,它可能生成看似合理但错误的描述,因此在关键应用场景中需对输出结果进行验证。
openai/gpt-image-1.5 的定价按 token 计算:输入 token 每百万 $8.00,输出 token 每百万 $32.00。这些费率由 OpenAI 设定,OrcaRouter 以零加价的方式传递。文本和图像数据均计入输入 token;图像根据其尺寸和分辨率,按照 OpenAI 的 token 化方案进行 token 化。输出 token 是模型生成的文本。计费按照每次 API 调用计量,无需最低用量。OrcaRouter 不收取任何额外的每次请求费用。
每个令牌的成本相较于小型语言模型偏高,但该模型专门针对需要视觉输入的多模态任务进行优化。对于处理大量图像且附带简短文本提示的应用,输入令牌成本将占主导地位。而对于生成长篇详细描述的应用,输出令牌将成为主要成本因素。目前尚无信息表明该模型是否支持提示缓存或对高用量提供折扣。建议开发者在决定采用此模型前,先估算典型请求的令牌数量。
OrcaRouter的API可能支持缓存机制,但这并非GPT-Image 1.5所特有。如果启用了缓存,重复的相同请求可能会减少计费的token数量,但提供商(OpenAI)决定是否应用缓存以及应用级别。用户应查阅OrcaRouter的文档以了解缓存行为和定价影响的详细信息。截至目前,OpenAI尚未就该模型的缓存功能发布公开声明,因此最稳妥的做法是假设没有缓存收益。
通过OrcaRouter使用openai/gpt-image-1.5的费用由平台现有的计量系统处理。费用根据API报告的token使用量累积,不额外收费。OrcaRouter提供使用仪表板,可近乎实时查看消耗情况。支付方式在账户级别配置。对于返回错误的失败请求,不予退款或积分;成功的API调用正常计费。用户应确保其速率限制设置合理,以避免意外费用。
要通过 OrcaRouter 调用 openai/gpt-image-1.5,请将基础URL设置为 https://api.orcarouter.ai/v1,并在聊天补全请求中使用模型参数 'openai/gpt-image-1.5'。该 API 与 OpenAI 的 Python 客户端库完全兼容;例如,在 Python 中,你可以设置 openai.api_base = 'https://api.orcarouter.ai/v1' 和 openai.api_key = 'your-orcarouter-key'。消息可以包含文本和图像内容,使用 'content' 数组,类型为 'image_url' 或 'image_base64',遵循 OpenAI 的多模态消息格式。
该API支持标准参数,例如'messages'(必需)、'max_tokens'、'temperature'、'top_p'、'frequency_penalty'和'presence_penalty'。除标准参数外,没有公开记录的模型特定参数。图像数据通过系统或用户消息中的'content'字段传递。图像的具体格式遵循OpenAI的惯例:使用'type': 'image_url',并附带一个包含'url'字段(base64数据URI或公共URL)的'image_url'对象。OrcaRouter可能施加额外限制,请参考其API参考文档了解详情。
如果您当前直接使用OpenAI的API来使用GPT-Image 1.5,迁移到OrcaRouter只需做两处更改:将基础URL更新为https://api.orcarouter.ai/v1,并将您的OpenAI API密钥替换为OrcaRouter API密钥。请求和响应格式完全相同,因此无需对消息结构进行代码更改。OrcaRouter以相同的供应商价格提供相同的模型,没有加价。此外,OrcaRouter可能提供与OpenAI自身服务不同的速率限制、日志记录和其他功能。
对OrcaRouter API的身份验证通过'Authorization'标头发送的API密钥完成:'Authorization: Bearer <your-api-key>'。API密钥从OrcaRouter后台获取。无需额外的OAuth或客户端证书。密钥必须保密,不得暴露在客户端代码中。OrcaRouter支持按密钥进行速率限制,并可针对不同应用生成多个密钥。密钥可随时从后台撤销。
GPT-4o是OpenAI推出的一款更大的多模态模型,也接受文本和图像输入。主要区别在于GPT-4o拥有更大的上下文窗口(128k个token),并且专为通用推理而设计,而GPT-Image 1.5则是一个上下文大小未知的专用模型。GPT-4o的定价为输入$5/M,输出$15/M,这使得GPT-Image 1.5更昂贵(尤其是输出)。在没有基准测试的情况下,目前尚不清楚哪个模型在图像相关任务上表现更好。GPT-4o对于混合工作负载可能更具成本效益,而GPT-Image 1.5则可能专门针对图像-文本理解进行了微调。
有专用的计算机视觉模型,如CLIP、DALL-E或专门的OCR引擎,它们在特定图像任务(例如分类、生成或文本提取)上可能性能更高。GPT-Image 1.5将图像理解与自然语言生成相结合,因此具有灵活性,但在狭窄任务上的准确性可能不如专用模型。例如,从文档中提取结构化数据时,专用OCR模型可能具有更高的准确性和更低的延迟,但GPT-Image 1.5能够遵循复杂的自然语言指令。选择取决于任务的复杂性以及对可解释性的需求。
OrcaRouter 以零加成的方式提供对 openai/gpt-image-1.5 的访问,在供应商定价上不加任何费用,即您只需支付 OpenAI 设定的确切费率。它提供与 OpenAI 兼容的 API,使现有用户可以轻松迁移。此外,OrcaRouter 还提供 OpenAI 本身不具备的功能,例如使用量追踪、日志记录、速率限制管理以及多模型路由。对于需要比较多个模型或集中管理 API 密钥的用户,OrcaRouter 提供了统一的接口,避免了供应商锁定。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1backgroundmoderationnoutput_compressionoutput_formatpartial_imagesqualitysize| 输入 / 1M tokens | $8.00 |
| 输出 / 1M tokens | $32.00 |
| 缓存读取 / 1M | $1.25 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_gpt_image_1_5,
title = {openai/gpt-image-1.5 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-1.5}
}openai. (n.d.). openai/gpt-image-1.5 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-1.5