
GPT-6.1 Sol 对决 DeepSeek V4 Pro:三把标尺,三种不同答案
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
问一问GPT-6.1 Sol和DeepSeek V4 Pro相差多少,诚实的答案是:这取决于你看的是哪一把标尺,而这三把标尺彼此之间的分歧,比任何模型对比在任何问题上的分歧都大。按每百万 token 的价格、以 3:1 的输入输出比混合计算,二者是 4.00 美元对 0.99 美元——相差四倍。按实际运行同一套评测的成本计算,每个任务是 0.72 美元对 0.67 美元——相差百分之七。在 Artificial Analysis 智能指数上,二者是 51 对 36——相差十六分,听起来很有决定性,直到你去看每个数字究竟是跟谁比出来的,因为这家评测机构自己的方法论就把这两个模型划在了不同的量级上。GPT-6.1 Sol 于 2026 年 9 月 26 日发布,输入 2.00 美元、输出 10.00 美元,上下文窗口为 1,050,000 个 token。DeepSeek V4 Pro 是一个以 MIT 许可证授权的混合专家旗舰模型,1.6 万亿参数、490 亿激活参数,于 2026 年 8 月 13 日发布,价格为 0.66 美元和 1.98 美元,上下文窗口为 1,048,576 个 token。其中一个是你可以下载的文本模型。另一个能看懂图像。理清这三把标尺中究竟该以哪一把为准,就是全部的工作。
索引行并不是它看起来的那种比较。
从被引用最多的那个数字开始,因为它最常被引用错。
Artificial Analysis 在发布其排行榜的同时也发布了它的方法论,其中有兩句话在此很关键。它表示,开放权重模型只与同一规模等级的其他开放权重模型比较——极小、小、中、大,分界线在 1500 亿参数。专有模型则改为在一个价格区间内进行比较,采用输入与输出 3:1 的混合比例。这是两个不同的同类比较组。DeepSeek V4 Pro 0813 是开放权重——评测方自己的 FAQ 这么说,并指向已发布的权重——其总参数量为 1.6 万亿,因此落入开放权重的大模型类别。GPT-6.1 Sol 是专有模型,并会按其自身价格区间内的模型来评分。
因此,同一张表中相邻两行里的 51.8 和 36 并不是一次正面对决。它们是针对一个同类模型集的得分,也是针对另一个同类模型集的得分,这正是每任务成本数据具有可比性、而原始指数数值不具可比性的原因。如果你想了解 DeepSeek V4 Pro 是否优秀,就可下载模型而言,36 才是回答这个问题的数字。如果你想知道它相较于一个托管的前沿模型表现如何,指数列不会告诉你,而在这种情况下,诚实的做法是承认这一点,而不是用 51.8 减去 36 并称之为差距。
可以清晰比较的是:价格卡片、上下文与输出上限、模态列表,以及运行同一套评测套件的成本——因为最后这项数字是对相同工作的核算,而不是一个评分。
{{1}}原始{{/1}}仪表显示的数据

• 输入价格 — GPT-6.1 Sol $2.00 对比 DeepSeek V4 Pro 每百万 token $0.66
• 输出价格 — GPT-6.1 Sol 10.00 美元,对比 DeepSeek V4 Pro 1.98 美元,并在工作日的两个四小时 UTC 时间窗口内阶梯调整至 1.32 美元和 3.96 美元
• 缓存读取 — GPT-6.1 Sol 为每百万 token $0.10,而 DeepSeek V4 Pro 为每百万 token $0.022;两者都支持缓存,且便宜的一方还要再便宜 4.5 倍
• 每个索引任务的成本 — GPT-6.1 Sol $0.72 对比 DeepSeek V4 Pro $0.67
• 在索引套件上输出的 token 数 — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• 最大输出 — DeepSeek V4 Pro 384,000 tokens 对比 GPT-6.1 Sol 128,000 tokens
• 模态 — GPT-6.1 Sol 支持文本、图像和文件;DeepSeek V4 Pro 仅支持文本
第四行和第五行是耐人寻味的一对。在同一个套件上,DeepSeek V4 Pro 输出的 token 数量是 2.4 倍,却以每任务便宜 7% 的成本完成,因为它的输出费率只有 GPT-6.1 Sol 的五分之一。当你衡量的是输出量而非费率时,价格驱动型模型就是这副样子:冗长是真实存在的,而它并未抹去这一优势。时段窗口就是那个星号注脚。工作日的两个四小时时段——一周 168 小时中的 40 小时——将标价费率翻倍至 1.32 美元和 3.96 美元,而这一附加费适用的,正是那些在两张卡上原本会是最便宜的同一批 token。
较便宜的型号不做什么
三件事,而每一件都是硬性约束,而非权衡取舍。
它看不见。DeepSeek V4 Pro 是文本输入、文本输出。不支持截图,不支持扫描版 PDF,不支持读取图表,不支持读取工单中的示意图。计算机操作和文档密集型工作流——正是 GPT-6.1 Sol 所定位的那类工作负载——无论什么价格都免谈。如果你的流水线已经把图像路由给视觉模型,这就不是问题;如果没有,这就是决定性约束。
它没有你可以据此规划的发布节奏。“deepseek-v4-pro”这个名称自八月以来就解析到了 0813 构建,而走到这一步并不平静:供应商曾宣布该构建将于 9 月 14 日退役,又在日期前两天撤回了公告,并继续以不变的计费方式提供 API 服务。我们自己的目录仍将其列为旗舰,具有相同的上下文、输出上限和并发上限。一个能在两天内撤回弃用公告的供应商,也可能选择不撤回;运维层面的结论不是这个模型不稳定,而是这个名称只是一个指针,而把行为固定到构建标识符而非路由名称上,才是廉价的保险。
它并不携带周边知识。GPT-6.1 Sol 发布仅八天,就已经有一份独立配置发布;DeepSeek V4 Pro 有更长的评估历史和庞大得多的实践者群体,包括已发布的服务栈和第三方吞吐量工作。对于自托管部署来说,这些材料的价值超过索引条目,因为当模型在你的硬件上而不是在基准测试上表现异常时,你要查阅的正是这些材料。
当便宜四倍的仪表是错误的那款仪表时
如果廉价模型只是在所有方面都更差,这篇文章会很短。尴尬的事实是,在相同工作上,两者每个任务相差 7%,而为了达到同样的效果,它们写出的内容量相差 2.4 倍。这意味着混合 token 计量指标——那个显示 4× 的——衡量的是一种你大多不会支付的差异,因为它为一个你可能永远不会发送的 token 组合定价。而指数计量指标——那个显示 16 点的——是在两个同类组之间进行衡量,无法相减。
所以实际的划分并不是“难活交给前沿模型,简单活交给便宜模型”。而是模态上的划分和体量上的划分。任何带图片的任务都交给 GPT-6.1 Sol,凡是答案简短而推理才是昂贵部分的任务也同样如此——它的五档推理强度(从 low 到 max,默认 medium)让你买的只是推理,而不是长篇大论,而 0.10 美元的缓存输入让冗长重复的提示词变得便宜。任何纯文本、高并发、且能容忍较长答案的任务——分类、抽取、摘要、在 384,000 token 输出预算下的大批量生成——都交给 DeepSeek V4 Pro,最好避开那两个 UTC 时间窗口。
两者都在同一个键上,而拆分只是一行配置。
两款模型均已在 OrcaRouter 上线,按其各自提供商公布的费率提供,不额外加价:GPT-6.1 Sol 为 $2.00 / $10.00,提示 token 超过 272,000 后升至 $4.00 / $15.00;DeepSeek V4 Pro 为 $0.66 / $1.98,并按所列保留两个限时时段。一个密钥、一张账单、一个 OpenAI 兼容端点,即可同时使用两者。
这就是上面这种拆分值得写下来、而不是拿来争论的原因。模态拆分可以表达为一条路由规则,因此携带图像的请求会发往视觉模型,而大量文本会发往便宜的那个,无需更改应用;如果某条路由降级,故障转移会改送该调用,而不是让它失败。而且由于两者位于同一端点,真正重要的价格对比——你的价格对比,基于你的流量、你的 token 组合——可以从你自己的发票中得出,而不是来自基准套件的平均值。


一句话结论:便宜四倍的说法才该被怀疑,7% 的读数才需要核实。四倍是混合计量对一种你可能不会发送的 token 组合给出的结果。7% 是同一评估在两者上的成本,而且其中还内含 2.4× 的冗长差异。十六个百分点是真实的,但它们同时也是跨越两个同类组得出的;而对这对模型的大多数部署来说,真正起决定作用的约束根本不是数字:其中一个模型能读截图,另一个不能。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
