
OpenAI o3 对决 DeepSeek V4 Pro:高级推理时代止于价格差距拉开之时
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
OpenAI o3与DeepSeek V4 Pro的对决,本质上是两个数字的碰撞。OpenAI o3于2025年4月16日发布,曾是高端推理的标杆——当错误答案的成本高于token成本时,你会愿意为它支付溢价。DeepSeek V4 Pro则以构建版本0813于2026年8月13日全面上市(GA),此前经历了安静的晚间发布,以及一次包括撤回公告和重新上传权重的推广过程。这个模型让那种溢价看起来像是一个范畴错误:它的独立指数高于o3,价格约为其五分之一,并且还开放权重。这场碰撞有时间戳:OpenAI o3将于2026年8月26日从ChatGPT中退出,其API快照将于12月11日步其后尘,而每一周的对比都对那个不会消失的模型有利。
两款理念不同且相隔一年发布的产品
o3是纯推理旗舰模型:一个闭源模型,经过训练会在作答前长时间思考,拥有20万上下文窗口、最多10万输出token,并将图像输入整合进其思维链。按照OpenAI自己的数据,它树立了2025年的标杆——AIME 2024上96.7%、GPQA Diamond上87.7%、无脚手架情况下SWE-bench Verified上69.1%、Codeforces Elo 2727——而OpenAI后来将其价格从每百万token $10/$40降至$2/$8,目前仍保持这一价格。DeepSeek V4 Pro则是完全不同的经济模式:一个1.6万亿参数的混合专家模型,每个token激活约490亿参数,拥有100万token上下文窗口、最大384K输出、仅支持文本输入,并且——0813正式版(GA)构建新增——重建了后训练技术栈,加上原生Responses-API和Codex集成,使其在DeepSWE上的智能体得分从预览版的12.8跃升至62.7。它同样是开放权重的:DeepSeek-V4-Pro-0813检查点可在Hugging Face上以MIT许可证下载,此前经历了混乱的首个24小时——发布横幅被撤下、权重文件一度404,直到修正配置后重新上架。
实际数字中的成本差距
费率卡本身就能完成大部分说服工作:
OpenAI o3 — 每百万输入 $2.00,每百万输出 $8.00,缓存输入 $0.50。推理令牌按输出计费,因此一个难题会在回答前消耗思考令牌。
• DeepSeek V4 Pro — 每百万输入 $0.435(缓存未命中),缓存命中 $0.003625,每百万输出 $0.87(今日价格)。输出比 o3 便宜约 4.6 倍,缓存命中的输入实际上近乎免费。
• 带有日期的警示——DeepSeek 计划于 8 月 17 日提价,将 V4 Pro 的输出价格在高峰时段从每百万 6 元提高到 27 元(非高峰时段为 13.5 元),缓存未命中的输入价格从 3 元提高到 9 元。即便在新增的高峰费率下,输出价格仍仅为 o3 的 8 美元的一小部分。以当前费率进行构建的时间窗口只有数天,这本身就是迁移考量的一部分。
按正确答案计费的经济学让这一点更加突出。o3 隐藏的推理 token 意味着,其每个难题答案的真实成本是输出费率的数倍。DeepSeek V4 Pro 也会推理,其思考过程同样按输出计费,但与一次思考一分半钟的 o3 会话相比,0.87 美元的绝对花费只是零头。DeepSeek 发布时采用的智能体成本框架——与闭源前沿模型相比单任务价格差距约为 45 倍——具体到 o3 则有所夸大,但方向并无争议:按工作负载不同,有效成本存在 4–10 倍的差距。
质量差距的实际状况
最关键的分数是独立评分。在 Artificial Analysis 的 Intelligence Index 上,DeepSeek V4 Pro 获得 53 分,在该指数当前列出的 104 个模型中排名第二;o3 约为 30 分——同一测试基准上相差 20 多分。这是对两年进展之后高端推理旗舰机型所处局面的最简洁总结:它不再仅仅是在价格上被压价,而是在独立综合评分上被击败。
每个基准测试的具体情况更加混乱,需要诚实的标注。DeepSeek V4 Pro 的头条智能体数据——Terminal-Bench 2.1 达 87.9、CyberGym 达 83.3、DeepSWE 达 62.7、AutomationBench 领先于封闭前沿模型——都是 DeepSeek 在 0813 发布时自行宣称的,截至本文写作时尚未被独立复现;而且这次部署过程中出现的错误配置事件意味着,没有人能确定早期第三方数据收集时 API 提供的确实是最终修正后的权重。o3 的发布基准同样来自厂商报告,但其中部分在 2025 年就经过了独立复测验证,当时它确实领跑推理榜单。在数学和纯推理方面,o3 已公开的成绩看起来仍优于 DeepSeek V4 Pro——DeepSeek 的优势在于智能体工具调用、编程和长周期任务,这与 o3 所主导的数学奥林匹克竞赛属于不同的测试体系。

o3仍然做得更好的方面
有两项优势在对比中依然成立。首先,数学与严谨推理:o3 的 AIME 96.7% 和 GPQA 87.7% 仍然高于 DeepSeek V4 Pro 已公开的任何成绩;如果你的任务是困难的证明或竞赛题,o3——只要它还在运行——是更稳妥的答案。其次,图像推理:o3 可以在思维链中思考截图或图表,而 DeepSeek V4 Pro 仅支持文本;0813 版本没有添加视觉编码器,如果你的任务需要模型读取图像,那么在这方面 DeepSeek V4 Pro 无法替代 o3。这两项优势都不足以成为留在一个即将退役的模型上的理由,但两者都足以让我们诚实地承认:这次迁移并非纯粹的升级。
另一个值得注意的点是开放权重的差异,这根本不是基准测试的问题。o3 已经闭源,如今正在被逐步收编并走向消亡;你无法在自己的硬件上继续运行它。DeepSeek V4 Pro 的 0813 检查点则永久属于你,采用 MIT 许可——相同的权重,相同的 1.6 万亿参数模型,只要你拥有大约 1.5 TB 的硬件资源,就可以自托管。对于那些因为依赖封闭模型而被供应商可能随时下架所伤害的团队而言,这是对 o3 退役所引发的确切问题的一个结构性回答。
正在迁移工作负载
对于刚从 o3 迁移过来的 API 团队,DeepSeek V4 Pro 是最便宜的落脚点,而且在大多数 API 实际使用所涉及的智能体与编码工作上,它很少是降级。真正的陷阱在于运营层面,而非质量:V4 Pro 在官方 API 上限制为 500 个并发请求,这个上限在运行智能体集群时很容易触达,而且它的定价将于 8 月 17 日调整。这两点正是路由层存在的意义。
在 OrcaRouter 上,DeepSeek V4 Pro 按提供商列表价提供,0% 加价透传——因此今天的 $0.44/$0.87 在 DeepSeek 上线当天即在此上线,8 月 17 日峰值/非峰值定价表生效时,当天也会在此同步更新。一个密钥同样可访问该 o3 替代模型群组中的其他模型;自动故障转移是应对 500 并发上限的简洁方案:将生产路径指向 V4 Pro,并在同一密钥上附带第二个模型,让路由器吸收该上限。OpenAI o3 本身不在该密钥上——在 12 月 11 日快照截止之前,它仍可通过 OpenAI 自己的 API 及多个第三方平台使用。

数学站在谁那边
对于任何将 o3 工作负载用于编码、智能体循环或长上下文处理的人来说,差距悬殊:DeepSeek V4 Pro 在独立指数上胜过 o3,成本仅为一小部分,而且其开放权重意味着这种特定依赖关系不可能在你毫无察觉的情况下被淘汰。目前真正有理由继续维持 o3 的团队是那些方向狭窄的团队——硬核纯数学推理,以及任何建立在 o3 图像思维基础上的东西——即便是这些团队,也应在 12 月之前用真实工作负载测试替代方案,因为截止日期不会在乎你的特殊情况。o3 所定义的高级推理时代随其退役公告而终结;DeepSeek V4 Pro 恰好是下一个时代中最便宜席位所在。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
