
Grok 4.7 对比 Qwen 3.8 Max:价格相同,仅差一分,形态相反
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两款闭源旗舰模型,输入均为每百万 token 2 美元、输出均为每百万 token 6 美元,在同一项独立基准测试中彼此得分相差不到一分,发布时间相隔十九天。Grok 4.7于 2026 年 9 月 21 日由 SpaceXAI 推出;Qwen 3.8 Max由该厂商于 2026 年 8 月 3 日发布,并于 2026 年 9 月 2 日更新。在当前的 Artificial Analysis Intelligence Index(版本 v4.3.2)上,Grok 4.7 得 46 分,Qwen 3.8 Max 得 45 分。在价格和测得能力上,这两款模型是同一次购买。而在其他一切方面——上下文、模态、服务速度、开放程度,以及各家厂商选择优化的方向——它们可谓天差地别,而这正是这次对比值得一做而非跳过的原因。
首先,时间线,因为 Qwen 3.8 Max 有两个日期
这一点会让许多报道出错,所以有必要在开头就把它说清楚。Qwen 3.8 Max 于 2026 年 8 月 3 日发布,是阿里巴巴规模最大、能力最强的模型,基于 Qwen 3.5 视觉语言架构打造,采用稀疏专家混合设计,据报总参数量达 2.4 万亿,每个 token 激活 950 亿参数。2026 年 9 月 2 日,阿里巴巴又推出了一个更新版本——0902 修订版,正是这个版本承载着当前的模型 ID,也是 Artificial Analysis 将其页面日期标注所依据的版本。如果你看到 Qwen 3.8 Max 同时有 8 月和 9 月两个日期,原因就在于此:一个是发布日,另一个则是如今大多数人实际所指的是修订版。
Grok 4.7 有着一段更清爽的历史,而其背后则是一段更混乱的历史。SpaceXAI 于 2026 年 9 月 21 日发布它,此前这次发布已屡次推迟——马斯克曾先后指向 8 月底、9 月初和 9 月中旬的时间窗口,而该模型直到之后才真正发布。这次发布本身范围很窄:基础模型比 Grok 4.6 更大,强化学习运行时间更长,面向多小时任务,并且 Grok 4.6 自 8 月 12 日以来一直沿用的 2 美元/6 美元费率卡没有变化。
每个供应商针对什么进行了优化
把这两则发布公告成对来读,其中的设计赌注几乎截然对立。
SpaceXAI 针对智能体执行进行了优化。Grok 4.7 厂商报告的数据集中在终端与代码仓库任务上:Terminal-Bench 4.0 为 38.0%,而 Grok 4.6 为 20.3%;CursorBench 4.0 为 46.3%;DeepSWE v1.1 在高推理强度下为 71.0%;EEBench 为 64.0%。该公司对此次发布的官方描述将 Grok Bot 环境中的自我验证与长上下文处理列为目标。Grok 4.7 提供 500,000 token 的上下文窗口,支持文本和图像输入,输出文本,并开放从 low 到 xhigh 的推理强度。这是一款为完成任务而打造的模型。
阿里巴巴为覆盖面做了优化。Qwen 3.8 Max 提供约 984,000 个 token 的上下文窗口——实际上相当于一百万——而其公布的强项是在单一领域中的广度而非深度:Terminal Bench 2.1 得分 86.6,SWE-bench Pro 为 67.7,PaperBench 为 93.0,GPQA Diamond 为 92.6,MMMU-Pro 为 82.3,OSWorld-Verified 为 86.1。它接受文本、图像和视频输入并返回文本,支持推理努力程度等级,默认值为 xhigh,而其公布数据中较弱的一项是 Humanity's Last Exam,为 43.6。它是一款为处理你交给它的任何任务而打造的模型。
那段文字里的每一个数字都是厂商自行报告的。两组数据都未经独立复现,而且这两组数据本来也无法直接比较——Terminal-Bench 2.1 和 Terminal-Bench 4.0 是不同的基准测试,因此 Qwen 的 86.6 和 Grok 的 38.0 绝不能被并列放在一起。
• 独立综合评分 — 在 AA Intelligence Index v4.3.2 上,Grok 4.7 得 46 分,而 Qwen 3.8 Max 在同一版本上得 45 分。统计上不相上下。
• 每百万 token 价格——两者均为输入 $2.00 / 输出 $6.00。Qwen 的缓存折扣标注为 88%,折合混合费率为每百万 $1.18;Grok 4.7 的缓存条款未以相同基准公布。
• 上下文窗口——Grok 4.7 为 500,000 个 token,而 Qwen 3.8 Max 约为 984,000 个。Qwen 以近两倍的优势胜出,这也是两者之间最大的单项规格差异。
• 输入模态——Grok 4.7 的文本与图像,对比 Qwen 3.8 Max 的文本、图像与视频。
• 权重——两者均为专有。两个模型都无法下载,这彻底消除了此类比较中通常涉及的开放权重论点。
• 参数 — Grok 4.7 在任何 SpaceXAI 规格表中均未披露(约 2.1T 这个数字是马斯克的说法),而 Qwen 3.8 Max 据报道总参数量为 2.4T、激活参数量为 95B,阿里巴巴也尚未在规格表中确认。
• 服务速度 — 据 Artificial Analysis 数据,Qwen 3.8 Max 的输出速度为每秒 38.8 个 token,首 token 耗时 3.08 秒;SpaceXAI 将 Grok 4.7 定位为速度约为同类模型的两倍,此数据由厂商自行报告,目前尚无独立发布的吞吐量数据。

上下文差异才是真正的决定因素
当价格与能力旗鼓相当时,胜负取决于其他所有差异,而在这里就是上下文。将窗口从 500,000 翻倍到约 984,000 个 token 并不是规格表上的小亮点——而是将代码库分块处理与将其完整容纳之间的天壤之别。
Qwen 3.8 Max 的更长的窗口附带了一个对买家而言很重要的、有据可查的注意事项:阿里巴巴宣布将于 2026 年 8 月 10 日那一周发布的开放权重版本仅支持文本,并未包含完整的百万 token 上下文。这并不影响本次对比所涉及的托管端点,但如果你原本打算围绕开放版本做规划,这一点值得了解。
在 Grok 这一侧还有第二个需要考虑的问题。Grok 系列历来在 200,000 个输入 token 处设置了一道价格断崖:一旦请求越过该阈值,整个请求就会按双倍费率重新计价——输入 $4,输出 $12。在 500,000 token 的窗口下,该阈值完全落在模型的工作范围之内。在将长上下文任务路由到 Grok 4.7 之前,请确认所部署模型的当前价目表,因为大窗口与重新计价断崖之间的相互作用,正是长上下文账单容易出问题的地方。
每项工作一个月的成本是多少
由于标称费率完全相同,成本比较就必须依据 token 行为,而不是依据价目表,而正是在这一点上,两个模型出现了可测量的差异。
Artificial Analysis 在运行其 Intelligence Index 时测得 Grok 4.7 生成了 2.4 亿个输出 token,而榜单上各模型的输出中位数为 9200 万个——它是一个啰嗦的推理模型。Qwen 3.8 Max 在同一指数上生成了 1.9 亿个输出 token,总评估成本为 4,934.79 美元,实测速度为每秒 38.8 个 token。两者的冗长程度都远高于中位数,而 Grok 4.7 是两者中更啰嗦的那个。
所以,在每百万输出同为 $6 的情况下,每项任务产生更多 token 的模型,每项任务成本更高。已公布的冗长度数据表明,对于同等的索引工作,Grok 4.7 会消耗更多输出 token,这意味着价格上的持平实际上让 Qwen 3.8 Max 在每任务成本上略占优势——但这一优势被 Grok 4.7 声称的速度优势所抵消,后者缩短了实际耗时,因而也降低了等待智能体运行的人力成本。这两项抵消因素都不会出现在价目表上,而且都值得在你自己的流量上实测,而不是凭空假设。
唯一没有争议的不对称之处在于缓存。Qwen 3.8 Max 公布了 88% 的缓存折扣,以及在 7:2:1 的缓存命中/输入/输出配比下 1.18 美元的混合费率。对于具有大型稳定前缀的工作负载——系统提示词、代码库头部、文档集——真正的节省就来自这一折扣,因此在承诺用量之前,值得先看看 Grok 4.7 的缓存条款与之相比如何。

当数字拒绝替你做出选择时,选择
在同一评分体系下,46分和45分,价格还相同,这已经是本博客可能发布的最接近真正平局的结果了。这意味着,决定应当基于两款型号真正存在差异的维度来做出,而这样的维度共有四个。
如果你的工作是智能体编程和终端执行,如果长时间运行时的挂钟速度比上下文余量更重要,如果你想通过按请求调节的推理旋钮让简单流量保持低成本,那就选 Grok 4.7。如果你经常处理超过五十万个 token 的输入,如果视频输入在你的路线图上,如果你想为前缀密集型工作负载获得 88% 的缓存折扣,或者你想要一个其供应商发布广泛评测矩阵、而非仅集中于单一领域的模型,那就选 Qwen 3.8 Max。
如果诚实的答案是“两者都需要一些”,那才是正常的答案,而这正是这对组合所为之打造的场景。Qwen 3.8 Max 已上线 OrcaRouter,采用阿里巴巴的标价,而 OrcaRouter 以 0% 加价率透传供应商标价,因此上面的 $2/$6 就是你实际支付的价格,供应商调价当天即在此生效,而无需等到续约时。一个 API 密钥即可覆盖 Qwen 3.8 Max 以及200 多个其他模型,这意味着上下文决策变成了按请求的路由规则,而非平台层面的承诺:把超长输入交给 984k 窗口,其余一切则留在对该任务而言最快、最便宜的那个端点上,并在供应商服务质量下降时自动故障转移。当某个任务确实需要两种形态时——先进行长上下文读取,再执行智能体执行流程——路由 DSL 可将模型组合成单次调用,而不必强迫你二选一。
有一点值得澄清:由于这两个模型都不是开源的,本次比较完全不涉及可下载的权重。两者都是托管式端点,而且两者都无法选择自托管。
值得记住的那个数字
四十六比四十五,不是选择模型的理由,也不应该是。决定这场比较的是上下文窗口——500,000 个 token 对大约 984,000 个——以及每家厂商所选择的形态:Grok 4.7 专为快速完成高难度智能体任务而优化,Qwen 3.8 Max 则专为处理你交给它的任何东西而优化。相同的价格,相同的实测能力,不同的任务。这是一个路由决策,而这类决策应该花一个下午去测试,而不是花一个季度去采购。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
