
GPT-6.1 Sol 对决 Qwen3.8-Max:看的是账单,而非价目表
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
拿一个夜间仓库维护任务,每晚运行一次,持续一个月,然后让GPT-6.1 Sol和Qwen3.8-Max轮流来做。按照 Artificial Analysis 的 v4.3.2 逐任务数据,GPT-6.1 Sol 在这三十个夜晚花费 21.72 美元,Qwen3.8-Max 花费 162.27 美元——每月相差 140.55 美元,一年约 1,690 美元,而这项工作按 token 计的价目表显示为输入 2.00 美元、输出 10.00 美元,对比输入 2.00 美元、输出 6.00 美元。两者的每百万 token 输入费率相差不到一个舍入误差,而这个中国模型在输出上便宜 40%,可账单却相差 7.5 倍。厂商于 2026 年 9 月 29 日发布 GPT-6.1 Sol;Qwen3.8-Max 则自 2026 年 8 月 3 日起就已上线。
这个差距不是什么定价花招,也不是基准测试造成的假象——它就是这项比较所要说明的全部,而它来自一个任何费率表都不会展示给你的数字。
每个模型是什么
GPT-6.1 Sol 是 OpenAI 当前在推理与编程领域的旗舰模型,在它所取代的 GPT-6 Sol 发布一周后推出,标价同为 $2.00 / $10.00,缓存输入价格为 $0.10,上下文窗口为 1,050,000 个 token。它面向智能体(agentic)类工作销售:在我们自己的模型卡上,它"最佳适用"标签写着推理、编程和智能体,并带有顶级质量评分。
Qwen3.8-Max 是阿里巴巴的智能体旗舰——一款闭源、仅提供 API 的模型,支持文本、图像和视频输入,并拥有 1,000,000 token 的上下文窗口。与规模较小的 Qwen 版本不同,这一款并未公开权重。在 Artificial Analysis 上,它的智能指数为 45.42,在 147 款模型中排名第 17;编程指数为 76.2,在该领域排名第 9。它并非弱模型。只是让它"思考"的代价太高了。
不在费率卡上的那个号码

Artificial Analysis 记录到,Qwen3.8-Max 每项任务输出 107,730 个 token,其中 70,830 个是推理 token。GPT-6.1 Sol 产生 38,128 个输出 token,其中 25,190 个为推理 token。回答同一个问题时,这款中国模型写出的 token 数量是前者的 2.8 倍,而每个 token 的成本却低 40%。
• 每项任务的输出 token 数 — 38,128 对比 107,730;Qwen 多输出 2.8 倍
• 其中推理 — 25,190 对比 70,830
• 每项任务成本 — 0.724 美元 vs 5.409 美元;Qwen 的成本高出 7.5 倍
• 每项任务用时——640 秒 vs 2,152 秒;约 11 分钟 vs 约 36
• 首个回答 token 耗时 — 332.0 秒 vs 55.1 秒
• 智能指数 — 51.83 对比 45.42
• 上下文窗口 — 1,050,000 对比 1,000,000 个 token
• 接受的输入类型 — 文本、图像和文件 vs 文本、图像和视频
把乘法算一下就发现折扣消失了。一个模型以低40%的费率输出接近三倍的token,并不意味着成本更低——仅输出成本就约为1.7倍,而按任务实测的数字显示,一旦把输入、缓存读取以及有效答案的长度考虑进去,真实倍数达到7.5。
注意第四行和第五行,因为它们指向相反的方向,合在一起恰好解释了 Qwen3.8-Max 是什么。它用 55 秒返回第一个 token,而 GPT-6.1 Sol 要花五分半钟;随后它用三十六分钟完成任务,而 OpenAI 的模型十一分钟就做完了。这是一个一开口就说话、思考却极为漫长的模型。对于以流式输出作答的聊天界面而言,这读起来就是响应迅速。对于无人值守的夜间任务而言,这则是你同样要为之付费的实际耗时。
Qwen3.8-Max真正领先的三个地方
整个套件中的指数差距为 6.4 点,这类数字常被引用,仿佛它是一致不变的。但事实并非如此,而这种分歧很能说明问题:
• GPQA Diamond — Qwen3.8-Max 0.9283 对比 GPT-6.1 Sol,本次运行未公布
• GDPval — 1,671.4 对比 1,575.09
• Terminal-Bench 2.1 — 0.8876,对比数据在本次运行中未公布
• AutomationBench — 0.5619 对比 0.6487
• SciCode — 本次运行未公布,而 GPT-6.1 Sol 为 0.5417
• CritPT — 0.1771 对比 0.3171
Qwen3.8-Max 在研究生级别的科学问题和职业任务样本上胜出,对于它这一代模型来说这是一个实打实的成绩,也是它的编程指数能在 138 个模型中排到第 9 的原因。它输掉了更难的、接近研究性质的评测——CritPT 上落后 14 分——并且在 AutomationBench 上落后 8.7 分,而后者恰恰是最接近无人值守计算机工作的那一项。这两项中你认为哪一项对你的工作负载更重要,才是真正的决定因素;6.4 分这个头条数字是对一场分歧取的平均值,而不是一个定论。
额外的 token 能换来什么,以及不能换来什么
长推理轨迹从定义上讲并非浪费。一个在困难任务上花费 70,830 个 token 进行深思的模型,正在做较短的模型可能跳过的事情;而在 Qwen3.8-Max 领先的那些评估中,这种深思很可能正是原因所在。失败模式在于,你会为它在每一项任务上付出代价,而不只是困难的任务。推理 token 数量是模型校准的属性,而不是问题难度的属性,而一个对一行提取都过度思考的模型,会让你为此买单。
要想弄清你的各项任务分别是什么,就不能再把模型选择当作全局设置。这就引出了配置变更这一部分。
我们自己的 GPT-6.1 Sol 模型卡载有该对象的服务数值:$2.00 / $10.00 的费率、1,050,000 token 的上下文窗口、首个 token 的 p50 为 4.54 秒,以及一个已存储的 Artificial Analysis 指数块,它与应用程序实际会据以路由的定价位于同一页面。

一键一表两款
两个模型都可以通过单个 OrcaRouter 端点访问——一个 API 覆盖 200 多个模型,提供商标价以 0% 加价直通。Qwen3.8-Max 的 OrcaRouter 卡片将实际服务费率与 1,000,000 token 上下文窗口、文本/图像/视频输入模态以及 1.014 亿 token 的七日用量并列呈现——这些是应用进行路由所依据的数字,与文章争论的数字相邻。这种直通计费对 Qwen3.8-Max 尤其重要,因为一个经济性由输出 token 用量主导的模型,其供应商可以随时重新定价,而直通计量意味着这一变化会在 Alibaba 发布当天就体现在你的账单上,而不是按照经销商的节奏。

这里更有意思的路由层用法是路由 DSL,它让你把多个模型组合进一次调用,而不是为整个应用只挑一个模型。把夜间任务拆开:用一个便宜的模型做分类和抽取,GPT-6.1 Sol 负责推理与验证步骤,Qwen3.8-Max 则留给那些任务——它的长时间深思与 GPQA 级别的科学能力确实能改变答案。剩下的交给自动故障转移——如果某个提供方在运行中途性能下降,请求会被转移,而不是让整批任务失败。
这两者都不是选择某个模型的理由。它们是你不必一次选定、然后一直将就下去的原因。
通话,以及值得关注的事项
只在深度思考确实值这个价的地方,才付这 7.5 倍的钱。对于通用的夜间作业,GPT-6.1 Sol 每项任务 $0.724 是站得住脚的默认选择,一年 $1,690 也是真金白银。而当任务是有可核查答案的硬科学或职业推理时,Qwen3.8-Max 在 GPQA Diamond 上的 0.9283 就值这些 token——这正是它做得更出色的具体之处。
值得关注的是 Alibaba 是否会重新定价。一个 token 用量为 2.8× 的模型,定价为 $2.00/$6.00,其定价方式仿佛 token 才是稀缺之物;而该模型自身的行为却让 token 变得充裕。如果输出费率发生实质性变化,本文中的计算也会随之变化,而传导计量表会在事情发生的同一天向你展示这一点。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
