GPT-5.3-Codex 是 OpenAI 最先进的自主编码模型,融合了 GPT-5.2-Codex 的前沿软件工程性能与 GPT-5.2 的更广泛推理和专业知识能力。它取得了最先进的成果...
GPT-5.3-Codex是OpenAI推出的大型语言模型,可通过OrcaRouter的OpenAI兼容API进行访问。该模型被明确命名为"Codex",表明其专注于代码生成与理解,但同时也支持通用推理任务。模型支持文本、图像和文件输入,适用于多模态工作流。凭借40万Token的上下文窗口和12.8万Token的最大输出长度,它专为需要单次请求处理大量信息的任务而设计。该模型在GPQA…
GPT-5.3-Codex在GPQA Diamond基准测试中获得了91.5分,该测试涵盖物理、化学、生物学及其他科学领域的研究生级推理能力。这表明该模型在复杂、多步推理问题上表现出色。它能够回答需要深入理解、综合多个事实以及逻辑演绎的问题。该模型不仅限于代码,还能处理抽象推理、数学计算和科学分析。然而,与所有大型语言模型一样,它在处理高度专业化或模糊问题时,偶尔可能产生不正确或不一致的输出。
作为Codex模型,GPT-5.3-Codex专为代码理解与生成而设计。它能根据自然语言描述或文件上下文,以多种编程语言生成代码。400K上下文使其能够考虑大型代码库,用于重构、错误修复或文档生成等任务。它还可以处理代码截图或架构流程图等图像,以辅助推理。虽然它能应对算法挑战和库的使用,但用户应验证输出的正确性,尤其是在生产环境中。
GPT-5.3-Codex 的定价为每100万输入令牌1.75美元,每100万输出令牌14.00美元。如果你的任务不需要大的上下文窗口(例如短提示、单轮查询),或者不需要GPQA Diamond分数所表示的高推理能力,那么更便宜的模型可能更具成本效益。例如,通过OrcaRouter可获得上下文窗口较小(8K-128K)且输出令牌成本较低的模型。考虑权衡:仅当你经常处理大型文档或需要针对复杂问题的最佳推理时,才使用GPT-5.3-Codex。
是的,GPT-5.3-Codex 支持在同一上下文窗口中接受文本、图像和文件输入。你可以同时提供图表图片、文字描述和 PDF 文件,模型会一并处理。这对于分析研究论文等任务非常有用——论文作为文件、图表作为图像,再用文字提出问题。模型将所有模态视为输入的一部分,受总 400K token 限制。请注意,图像会占用 token 额度;实际可容纳的图像数量取决于其分辨率和编码方式。
GPQA Diamond是一个由多项选择题组成的基准测试,涵盖需要研究生水平推理能力的科学学科。它对人类和AI模型而言都极具挑战性,通常需要深厚的专业知识和多步推理。91.5分意味着GPT-5.3-Codex正确回答了91.5%的问题,这是一个很高的分数,表明该模型能够处理复杂的、专家级别的问题。然而,基准测试分数并不能保证在所有实际任务中的表现,它衡量的是在受控条件下的特定能力。
高GPQA钻石分表明,GPT-5.3-Codex在需要仔细推理的任务中表现出色,例如回答技术问题、调试代码或解释科学概念。它可以处理细微差别并避免常见陷阱。在实践中,这意味着与得分较低的模型相比,用户可以在复杂提示上获得更高的准确性。然而,该分数是一个平均值;该模型在某些问题类型或边缘情况下仍可能失败。建议在您所在领域的代表性任务上测试该模型。
延迟取决于请求大小、输出长度以及OpenAI基础设施的当前负载。OrcaRouter直接将请求传递给OpenAI,不进行额外处理,因此延迟由提供商决定。400K上下文窗口和128K输出意味着非常长的输入或输出可能需要更长的处理时间。对于实时应用,建议使用较短的上下文或更小的模型。未提供具体的延迟数据;用户应使用其典型输入进行基准测试。OrcaRouter不会在OpenAI的响应时间之外引入任何额外延迟。
尽管GPQA钻石得分很高,GPT-5.3-Codex仍有局限性。它可能给出自信但错误的答案(幻觉),尤其是在冷门话题上。其知识截止日期未指定,可能缺乏最新信息。该模型在非科学推理(如创意写作或常识)方面的表现可能不如在研究生级科学领域出色。它对提示措辞敏感,且输出可能冗长。此外,400K上下文窗口是最大值;当上下文非常满时,性能会下降,尤其是中间部分。用户应在关键任务上验证输出。
定价为每100万输入Token 1.75美元,每100万输出Token 14.00美元。这是OpenAI提供商的费率;OrcaRouter不加价。输入Token包括所有文本、图像Token(基于分辨率)和文件Token。输出Token是生成的文本。举例来说,一个请求包含10万输入Token和5000输出Token,则输入费用约为0.175美元,输出费用约为0.07美元,总计0.245美元。成本与使用量线性增长。没有额外的每次请求费用。用户根据实际Token消耗计费。
每百万输入令牌1.75美元的价格相较于一些高端模型适中,而每百万输出令牌14美元的价格则相对较高。输出令牌昂贵是因为生成过程计算密集。如果您的工作流程涉及生成非常长的回复(例如5万令牌),成本可能会相当高。请考虑使用上下文较小的更便宜模型是否能满足您的简单任务需求。此外,请注意该模型的大上下文可能促使用户加入更多输入令牌,从而增加成本。建议优化提示词,以保持输入和输出令牌的精简。
OrcaRouter 以提供商费率直通,不加价。未提及针对此模型的缓存或折扣计划。按消耗的令牌数计费。如果您有高量需求,可联系 OrcaRouter 咨询可能的批量定价,但未提供具体细节。为管理成本,请监控令牌使用情况并设置限制。响应的缓存并非标准功能;每个请求独立处理。由于模型通过 OpenAI 访问,OpenAI 的任何缓存或提示缓存功能均适用,但 OrcaRouter 不添加其自身的缓存层。
您通过OrcaRouter的OpenAI兼容API调用模型,基础URL为 https://api.orcarouter.ai/v1。使用的模型ID为"openai/gpt-5.3-codex"。该API与OpenAI Python客户端、curl及其他工具兼容。Python调用示例: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your_key") response = client.chat.completions.create( model="openai/gpt-5.3-codex", messages=[{"role": "user", "content": "Hello"}] ) 对于多模态输入,请使用适当的格式,并按照OpenAI多模态API的要求使用image_url或文件附件。
API支持标准OpenAI参数:messages(消息对象列表)、temperature、top_p、n、max_tokens、presence_penalty、frequency_penalty、stop、stream等。对于多模态,消息可以包含类型为text、image_url(含detail参数)或file对象的内容部分。max_tokens参数不应超过模型的最大输出128,000。400,000令牌的上下文窗口是所有消息和模态的总输入令牌。没有上下文长度参数;模型自动使用提供的完整上下文。请确保您的总输入令牌在限制范围内。
迁移很简单:将API调用中的模型字段从之前的模型ID(例如 "openai/gpt-4o")改为 "openai/gpt-5.3-codex"。确保您的API密钥用于OrcaRouter,并且您正在使用基础URL https://api.orcarouter.ai/v1。注意不同的上下文和输出限制。如果您之前的模型上下文较小,您的提示现在可能完全适合。如果之前未使用过多模态格式,您可能还需要调整多模态格式。使用示例请求进行测试以验证行为和成本。API响应格式与OpenAI的相同。
OrcaRouter 使用 API 密钥进行身份验证。您必须在 Authorization 标头中以 Bearer token 的形式包含您的密钥。从您的 OrcaRouter 账户获取 API 密钥。该密钥用于跟踪使用情况和计费。没有额外的身份验证层。基础 URL 是 https://api.orcarouter.ai/v1。确保您的客户端库支持自定义基础 URL。为了安全,请将您的 API 密钥保密并定期轮换。OrcaRouter 不为此端点提供 OAuth 或其他身份验证方法。
与GPT-4o-mini或GPT-3.5等模型相比,GPT-5.3-Codex提供了更大的上下文窗口(400K对比通常的8K–128K)和更高的输出限制(128K对比4K–16K)。其91.5的GPQA Diamond分数表明其推理能力更优。然而,每个token的成本更高,尤其是输出方面。较小的模型更适合高吞吐、低成本且无需复杂推理的应用场景。当您需要处理大量数据或要求尽可能最佳的回答质量时,请选择GPT-5.3-Codex。
许多多模态模型接受文本和图像,但GPT-5.3-Codex额外支持文件输入。其400K token的上下文窗口相对于大多数多模态模型(通常为128K)较大。91.5的GPQA Diamond分数在绝对值上较高,但直接比较取决于具体基准。其他提供商提供的模型可能具备不同优势,例如专门的视觉能力或更低的延迟。GPT-5.3-Codex是一款具备强大推理能力的通用模型;对于纯粹基于图像识别的任务,专用视觉模型可能效率更高。
如果您的任务不需要400K上下文或128K输出,使用较小的模型会更经济高效。如果您主要追求速度,请考虑延迟更低的模型。如果仅需文本输入,纯文本模型可能更便宜。对于科学推理领域以外的任务(例如创意写作),针对对话优化的模型可能表现更好。此外,如果您需要在特定硬件上运行模型或有数据驻留要求,可考虑部署在这些区域的模型。请根据实际工作负载进行评估。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-5.3-codex",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningresponse_formatseedstreamstructured_outputstool_choicetools| 输入 / 1M tokens | $1.75 |
| 输出 / 1M tokens | $14.00 |
| 缓存读取 / 1M | $0.175 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gpt_5_3_codex,
title = {GPT-5.3-Codex API},
author = {OpenAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-5.3-codex}
}OpenAI. (2026). GPT-5.3-Codex API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-5.3-codex