
Qwen 3.8 对比 GPT-5.6:既然两者都已定价,谁会胜出?
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百万 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 203 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
当阿里巴巴于2026年7月19日在上海预览Qwen3.8-Max时,社区反应立竿见影:这个拥有2.4万亿参数的模型“据称领先GPT-5.6,仅略微落后于Fable 5。”OpenAI的GPT-5.6旗舰Sol配置在独立的Artificial Analysis Intelligence Index上位列第二,比Fable 5低一分——在没有公布任何数据支持的情况下,这无疑是个大胆的说法。
自那以来,有两件事发生了变化。Qwen3.8-Max于2026年8月3日正式全面可用,并配有真实的价目表和真实的基准测试表。7月31日,OpenAI 下调了 GPT-5.6 全系产品的价格——Terra 降至 $2 / $12,Luna 降至 $0.20 / $1.20,Sol 则保持高端档位不变。因此,这场对决不再是空口对标排行榜,而是两款明码标价、有据可查、可以真正进行比较的模型。
给开发者的一条提示——最快解决这类争议的方法,就是在你自己的提示词上把两者都跑一遍。OrcaRouter 通过一个兼容 OpenAI 的端点汇集了 200 多个模型,因此你可以在同一任务上让 Qwen 3.8 Max 与 GPT-5.6 直接对垒,无需接入两套 SDK。
TL;DR 结论。Qwen3.8-Max 在正式发布(GA)时定价很激进——每 100 万 token 统一收取 $2 / $6——这让它的输入价格与 GPT-5.6 Terra 持平,但输出成本只有 Terra 的一半,也远低于 Sol。它自报的数据很强(GPQA Diamond 92.6,Terminal-Bench 2.1 86.6)。但 GPT-5.6 Sol 仍然在决定生产使用的两件事上胜出:它是经审计的第 2 名(Artificial Analysis Intelligence Index 约 59),而且速度很快——在 Cerebras 硬件上可达每秒 750 token。Qwen3.8-Max 仍未得到任何独立评估机构的评分。所以 Qwen 在一次性生成质量上很可能与 GPT-5.6 相当,并在输出价格上明显胜过 Terra;但 GPT-5.6 在经同行评审的验证和吞吐量上胜出,而这往往才是决定成败的关键。
关键要点
• Qwen3.8-Max 自 2026 年 8 月 3 日起正式发布(GA),公布的定价为$2 / $6每 1M tokens,在整个 1M-token 上下文中价格统一。
• 与 GPT-5.6 Terra 相比(OpenAI 7月31日降价后为 $2 / $12),Qwen 在输入价格上持平,输出价格则减半。与 Sol 相比,Qwen 的价格要便宜得多。
• GPT-5.6 Sol 经审计名列第2,在AA Intelligence Index上得分约59;Artificial Analysis 指出其在最难的STEM问题上领先。Qwen3.8-Max 目前尚未获得评分,AA和LMArena均未收录。
• 速度差异最为明显。GPT-5.6 的运行速度最高可达750 tokens/sec(在 Cerebras 上)。在预览版实测中,Qwen 是速度最慢的模型——该发现是在正式版(GA)上线之前得出的,需要重新测试。
• Qwen 的厂商数据表可信但未经同行评审:GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(较前代模型的 40.7 有所提升)。
• 开放性使它们永久分化: Qwen 承诺本周内开放权重,外加一个约需 17GB 显存的 Qwen3.8-27B;GPT-5.6 则闭源且仅提供 API。
准确性说明:所有 Qwen3.8-Max 的质量数据均由阿里巴巴报告,未经第三方验证。GPT-5.6 的数据来自 Artificial Analysis,可能与 OpenAI 自身的报告有所不同。GPT-5.6 系列定价反映了 OpenAI 于 2026 年 7 月 31 日进行的降价。Qwen 的定价采用 GA 费率表,取代了 7 月的预览折扣。
规格与价格,并列对比
以下是硬数据,每项数据均注明其来源。
• 制造商/状态 — Qwen3.8-Max:Alibaba;正式发布(2026年8月3日);GPT-5.6 Sol:OpenAI;闭源旗舰(变体:Sol / Terra / Luna)
• 架构 — Qwen3.8-Max:总参数量约2.4T,稀疏MoE(激活参数仍未公开);GPT-5.6 Sol:闭源;架构未公开
• 上下文窗口 — Qwen3.8-Max:1M tokens(思考模式下为 983,616;最大输出 131,072);GPT-5.6 Sol:长上下文旗舰
• AA Intelligence Index — Qwen3.8-Max:尚未评分;GPT-5.6 Sol:~59 — 第2名(Artificial Analysis)
• 经审计的优势 — Qwen3.8-Max:无第三方;GPT-5.6 Sol:领衔最难的STEM问题(Artificial Analysis)
• 厂商报告的优势 — Qwen3.8-Max:GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1(阿里巴巴报告);GPT-5.6 Sol:不适用
• 速度 — Qwen3.8-Max:p50 TTFT 1.64s(OrcaRouter 7 天遥测数据);预览版实测中速度最慢的模型;GPT-5.6 Sol:在 Cerebras 上最高可达 750 tok/s(Artificial Analysis)
• 定价(输入/输出)— Qwen3.8-Max: $2.00 / $6.00 每1M,统一价格;缓存输入 $0.25;GPT-5.6: Terra $2 / $12,Luna $0.20 / $1.20,Sol 溢价(约为 Fable 每 AA 成本的 1/3)
• 开放权重 — Qwen3.8-Max:承诺本周内发布(尚无许可证);GPT-5.6:不开放 — 闭源 / 仅限API
两件事为这一对比提供了框架,而这两件事都是七月以来才出现的。
首先,价格故事变得真正有趣,而不只是便宜。七月时,Qwen的优势还只是一个无法预算的折扣。现在对比变得具体,并按档位分化。相比Terra at $2 / $12,Qwen在输入价格上完全持平,输出价格则减半——在输出占开支主导的推理密集型任务上,这是真正的优势。相比Luna at $0.20 / $1.20,Qwen贵了10倍,对于大批量简单任务,Luna是更好的选择。相比Sol,Qwen便宜得多。因此“哪个更便宜”现在有三个不同的答案,取决于你指的是哪个GPT-5.6——而诚实的说法是,OpenAI在7月31日的降价显著缩小了差距。
其次,速度这一项仍然是两者差异最大的地方,而且依然对OpenAI有利。Artificial Analysis在Cerebras芯片上测得GPT-5.6 Sol的速度高达每秒750个token。阿里巴巴的GA资料中没有任何内容表明Qwen3.8-Max是为这种吞吐量而设计的,而预览时期那位称其为“他用过的最慢模型”的评测者,测的恰恰是吞吐量会不断累积放大的长周期智能体运行。如果你的工作负载是交互式、智能体型或高并发量,这个差距在质量还没进入讨论之前就能决定胜负。

证明:GA基准表解决了什么,又没有解决什么
阿里巴巴在正式发布(GA)时公布数据,相比预览版是一大进步。当时社区流传的“领先GPT-5.6”的说法,完全没有任何已发布的数据支撑。这份成绩单相当亮眼:GPQA Diamond 92.6(研究生级科学)PaperBench 93.0(复现研究成果)Terminal-Bench 2.1 86.6(操作真实Shell)OSWorld-Verified 86.1(操控桌面GUI)。编程能力的代际跃升是最突出的亮点——FrontierSWE 73.5(前代为40.7),而DeepSWE 1.1 56.6(前代为21.6)。
该表格并不能解决GPT-5.6的对比问题,原因有二。
第一点是来源可靠性。所有数据都是由阿里巴巴在自己的测试框架上生成的。厂商的榜单是挑选出来的,而非抽样得到的——实验室只会公布自己表现优异的基准测试,而省略其余部分。相比之下,OpenAI在Intelligence Index中排名第二则是由与结果没有利害关系的评估者评定的。值得注意的是,Artificial Analysis特别指出GPT-5.6 Sol在最难的STEM问题上领先,而这正是Qwen的GPQA Diamond 92.6声称要占据的领域。其中一项说法已经得到了验证。
第二点是,阿里巴巴自身最薄弱的数据就很能说明问题。IFBench 82.8——即约束条件下的指令遵循——是其表格中的最低分,这与预览期最一致的批评完全吻合:模型过度输出、超出范围、添加了没人要求的内容。这在演示中很讨喜,但当输出按每百万 token 6 美元计费,而你需要的是一种精确格式时,代价就很高。对于下游步骤需要解析输出的智能体流水线而言,指令遵循的纪律性比一个 GPQA 分数点更重要。
作为参照:前代 Qwen3.7-Max 得分46(在 AA Intelligence Index 上),而 GPT-5.6 Sol 约为 59。一代之内追平 13 分的差距将是非凡的飞跃。有可能——阿里巴巴自家的 FrontierSWE 近乎翻倍的表现表明确有实质进展——但在有评测者公布数据之前,“超越 GPT-5.6”仍是一个未经证实的说法,而非既定结果。

实际成本:跨层级的实例分析
以一个推理代理为例,它每次调用发送 100,000 个 token 的上下文,并生成 10,000 个 token 的输出——这是文档分析或多步规划的典型形态。
• Qwen3.8-Max: 0.1M × $2 = $0.20,加上 0.01M × $6 = $0.06。 ≈ 每次调用 $0.26。
• GPT-5.6 Terra:0.1M × $2 = $0.20,加上 0.01M × $12 = $0.12。每次调用 ≈ $0.32。
• GPT-5.6 Luna: 0.1M × $0.20 = $0.02,加上 0.01M × $1.20 = $0.012。≈ 每次调用 $0.03。
• 在每天5,000次调用时:Qwen ≈ $1,300,Terra ≈ $1,600,Luna ≈ $160。
两个教训浮出水面。在对阵Terra时,Qwen的节省是真实的但幅度有限——在这个形态上大约为19%——远未达到Qwen相对于Fable 5或Sol等高端模型所享有的数量级优势。任何曾认为OpenAI在成本结构上天然昂贵的人都应该更新认知:7月31日的降价已经在中端市场完成了大部分削弱Qwen定价优势的工作。
Qwen 大幅领先之处在于长上下文和缓存。由于 $2/$6 的费率在整个 1M token 窗口内保持平稳,一个 90 万 token 的提示词与短提示词的每 token 成本相同,而许多竞争对手会对长输入额外收费。与此同时,缓存输入以每 1M $0.25的价格,在重复上下文工作负载下将输入端成本降低 8 倍:上述调用在上下文被缓存后,成本从 $0.26 降至约 $0.09。如果你的智能体每一轮都重新读取基本稳定的上下文,持久的优势就在于此——而不是在标称费率上。
开放性与27B兄弟
GPT-5.6永远无法自托管。Qwen3.8-Max或许可以——阿里现在表示权重文件本周内就会发布——但旗舰模型并非切实可行的目标:4-bit量化后约1.2TB的规模,对比每块H200约141GB的显存,意味着需要八块或更多顶级加速卡,而且由于活跃参数数量仍未公开,你甚至无法估算这样的配置能换来多少吞吐量。此外,目前依然没有许可证文本,这意味着其商业可用性在形式上仍未确定。
同时发布的Qwen3.8-27B对任何关注Qwen可控性而非原始能力的人来说,是更具意义的发布。同样采用开放权重,据报道它运行大约需要17GB的显存——一张高端消费级显卡——这使其成为一种真正的本地部署选项,而2.4T旗舰模型永远无法做到这一点。如果你因数据驻留需求而在Qwen与GPT-5.6之间权衡,27B就是值得评估的模型。
常见问题
Qwen 3.8 是否比 GPT-5.6 更好?
并非基于现有证据。阿里巴巴的 GA 基准表现强劲(GPQA Diamond 92.6,Terminal-Bench 2.1 86.6),但这完全是自我报告的数据,且没有独立评估机构对该模型进行过评分。GPT-5.6 Sol 在经审计的智能指数中位列第二(约 59),根据 Artificial Analysis 的评测,它在最难的 STEM 问题上领先,运行速度高达 750 tokens/秒。GPT-5.6 在实证和速度上胜出。
"Qwen 3.8 is ahead of GPT-5.6" 这一说法是真的吗?
这最初只是社区情绪,至今仍未得到证实。正式发布(GA)带来了 Alibaba 自家的基准测试表,但没有第三方评分——Artificial Analysis 和 LMArena 仍无分数。前代 Qwen3.7-Max 得分为 46,而 Sol 约为 59,因此该说法若要字面上成立,需要一次跨度极大的代际飞跃。
哪个更便宜,Qwen 3.8还是GPT-5.6?
{{1}}这取决于档位,答案在7月31日OpenAI降价时发生了变化。{{/1}} {{2}}Qwen3.8-Max 每100万个的价格为 $2 / $6。GPT-5.6 Terra 是 $2 / $12——输入价格相同,输出价格翻倍,所以 Qwen 在这方面胜出。{{/2}} {{3}}Luna 是 $0.20 / $1.20,比 Qwen 便宜约10倍。{{/3}} {{4}}Sol 是高端产品,因此 Qwen 比 Sol 便宜得多。{{/4}}
哪个更快?
GPT-5.6 在吞吐量上具有决定性优势。Artificial Analysis 报告称其在 Cerebras 硬件上可达每秒 750 个 token。Qwen3.8-Max 在 OrcaRouter 的 7 天遥测中,p50 首 token 延迟为 1.64 秒,但预览期评测者发现其在长时 agentic 构建中速度很慢——该发现早于 GA 服务,值得重新测试。
Qwen 3.8 Max 退出预览了吗?
是的,2026年8月3日。它现在已发布费率卡,并提供兼容OpenAI和DashScope的端点,因此7月份关于Qoder积分活动享90%折扣的说法已不再反映其当前的销售方式。
我可以自托管 Qwen 3.8 来避免 OpenAI 的收费吗?
{{1}}实际上,这并非旗舰型号。{{/1}}{{2}}权重文件承诺将在一周内发布,但尚未公布任何许可证,{{/2}}{{3}}而且以4位精度量化后约1.2TB的规模,你需要八块或更多H200级别的GPU。{{/3}}{{4}}同期发布的Qwen3.8-27B{{/4}}{{5}}据称仅需约17GB显存,是更实际的选择。{{/5}}
我今天应该用哪一个?
GPT-5.6 Sol 适用于任何对延迟敏感、交互式或推理要求严格的场景,在这些场景中,经过审计的质量至关重要。Luna 适用于大批量简单任务,在这些任务中,它的成本远低于其他选项,优势最为明显。Qwen3.8-Max 适用于长上下文和提示缓存主导账单的场景——其固定的 1M token 费率和 $0.25 缓存输入价格是整个方案中最具竞争力的部分。
底线
Qwen 3.8 与 GPT-5.6 的较量 比七月份时更加公平,而且在价格上也不像 Qwen 粉丝预期的那样一边倒。Qwen3.8-Max 在正式发布(GA)时给出了真实定价、可信的自报基准测试表,以及统一的 1M-token 费率和廉价缓存,使其在长上下文工作上真正具有吸引力。这些是结构性优势,而非促销性优势。
但 OpenAI 7 月 31 日的降价削弱了中端市场的成本论据——Terra 在输入价格上现已与 Qwen 持平——而 GPT-5.6 仍拥有两个决定性特质:其一是来自与结果毫无利害关系的评估方的经审计 #2 排名,其二是高达 750 tokens/秒 的吞吐量,而 Qwen 没有任何接近该水平的迹象。关注两件事:Qwen3.8-Max 的首个独立 Intelligence Index 评分,以及权重连同许可证一同落地。在此之前,按形态路由——当速度和证明至关重要时选 GPT-5.6,当上下文长度和缓存命中主导账单时选 Qwen——并在你自己的提示词上验证。

本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
