一篇对比 GPT-6 Sol 与 Qwen3.8-Max 的文章的主视觉标题卡,标题为“GPT-6 Sol vs Qwen3.8-Max”,副标题为“封闭模型唯一无法竞争的一条线”,其中 GPT-6 Sol 显示为文本和图像输入,Qwen3.8-Max 显示为文本、图像和视频输入。
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max:闭源模型无法竞争的那一条线

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

几乎所有在GPT-6 SolQwen3.8-Max之间的比较都将由成本决定,而几乎所有此类比较都会朝同一个方向把成本算错。Qwen3.8-Max是供应商托管的旗舰模型,自其 2026 年 8 月 3 日全面可用以来,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,带日期的Qwen3.8-Max-0902快照于 9 月 2 日发布。GPT-6 Sol于 2026 年 9 月 22 日全面可用,输入价格为 2.00 美元、输出价格为 10.00 美元。输入价格相同,而按 Qwen3.8-Max 的价目表,输出价格便宜 40%——并且,在独立测试框架上,完成一项任务的成本大约为对方的五倍。

但还有第二个更清晰的差异,被成本论证不断掩盖,而它才真正决定某些工作负载。Qwen3.8-Max 接受视频。GPT-6 Sol 不接受。这不是一条价格线,也不是一条基准线;这是其中一款模型具备、另一款无法企及的能力,也是这场对比中无论做多少 token 效率方面的工作都无法弥补的部分。

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

两款旗舰,两种不同的形态

Qwen3.8-Max 是一个 2.4 万亿参数的稀疏专家混合模型,每次查询约有 950 亿参数处于激活状态,是生产环境中规模第二大的托管模型,仅次于 Kimi K3。其上下文窗口为一百万个 token,输出上限为 131,072 个 token,输入模态包括文本、图像和视频,并支持低、中、超高三个档位的推理力度,以及结构化输出和工具调用。托管旗舰版本并非开放权重;同代的可下载产物是单独发布的,有其自身的局限。

GPT-6 Sol 支持文本和图像输入、文本输出。它的窗口为 1,050,000 个 token,最大输入为 922,000 个 token,输出上限为 128,000 个 token;定价为统一的 $2.00 和 $10.00,其中缓存读取为 $0.20,缓存写入为 $2.50;当输入 token 超过 272,000 时,整个请求将重新定价为 $4.00 和 $15.00。它是闭源的、单一标识符的,OpenAI 将这一费率描述为永久性而非促销性的。

窗口数值彼此相差约 7% 以内,输出上限也处在同一区间。模态列表是唯一的结构性差距——而且它是单向的。

逐行

• 输入 — GPT-6 Sol 每百万 token 2.00 美元 vs Qwen3.8-Max 每百万 token 2.00 美元;头条数字完全相同

• 输出 — GPT-6 Sol 每百万 token 10.00 美元,对比 Qwen3.8-Max 每百万 token 6.00 美元;阿里巴巴的价格低 40%

• 缓存输入 — GPT-6 Sol 每百万 tokens $0.20,对比 Qwen3.8-Max 每百万 tokens $0.25 用于隐式缓存读取,其中显式缓存读取为 $0.17,显式缓存写入为 $2.50

• 上下文窗口 — GPT-6 Sol 1,050,000 tokens 对比 Qwen3.8-Max 1,000,000 tokens

• 最大输出 — GPT-6 Sol 128,000 tokens 对比 Qwen3.8-Max 131,072 tokens

• 输入模态 — GPT-6 Sol 支持文本和图像,而 Qwen3.8-Max 支持文本、图像和视频

• 长上下文处理 — GPT-6 Sol 对超过 272,000 输入 token 的整个请求重新定价,输入和缓存费率为 2×,输出为 1.5×;相比之下,Qwen3.8-Max 在整个窗口内采用统一费率档位,这是 Qwen 价目表在结构上更优而非仅仅略便宜的唯一之处

• 推理强度 — GPT-6 Sol:无、低、中(默认)、高、极高、最高 对比 Qwen3.8-Max:低、中、超高

• 知识截止日期 — GPT-6 Sol 为 2026 年 4 月 20 日,而 Qwen3.8-Max 未公布为单一日期

• 带日期快照——GPT-6 Sol 仅有一个滚动标识符,而 Qwen3.8-Max-0902 则以相同价格提供固定为 2026 年 9 月 2 日的修订版

长上下文这条线值得比通常更多的关注。GPT-6 Sol 的附加费是对整个请求施加的一步计费,因此一次 90 万 token 的智能体运行会在每个 token 上按 4.00 美元和 15.00 美元计费。Qwen3.8-Max 则是在整个窗口内统一收取一档费用。对于运行在 272,000 个 token 以上的工作负载,这两张价目表根本不再具有可比性——表面标价更便宜的那个模型反而要贵得多,而差距的方向完全取决于你的上下文处在什么位置。

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

价目表上写着便宜40%。测试框架给出的账单却是五倍。

Artificial Analysis 测得 Qwen3.8-Max-0902 在 Intelligence Index 上的得分为 45,每完成一个指数任务成本为 5.41 美元,整个运行过程生成了 1.9 亿个输出 token。其摘要将该模型描述为“明显缓慢且非常啰嗦”。GPT-6 Sol 得分为 48,每个任务成本 1.06 美元,输出 token 为 7700 万个。

把这三对数据放在一起看,这场对决的轮廓就显现出来了。Qwen 落后三个指数点,生成的 token 数量是 2.5 倍,而每完成一项任务的成本约为 5 倍——而且还是在它自己的输出价格便宜 40% 的价目表上。其中的机制并不隐晦。按每百万输出 token 6.00 美元计算,1.9 亿 token 仅输出一项、尚未计入输入,每次指数运行就要花 1.14 美元;按每百万 10.00 美元计算,Sol 的 7700 万 token 成本为 0.77 美元。更便宜的费率买到的是更多 token,而不是更小的账单。

这与整个九月领域中出现的模式如出一辙,而且值得把它当作一条规则、而不是关于这两个模型的事实来陈述:在按 token 计费的费率卡上,如果模型输出的 token 数是原来的两倍半,那么 40% 的输出折扣就一文不值。每完成一项任务的成本,才是唯一站得住脚的指标。

阿里巴巴发布了什么,以及努力程度设定的问题

阿里巴巴自己的基准测试表是本次对比中最长、也最缺乏可比性的一张。厂商自报的数据显示,Qwen3.8-Max 在 PaperBench 和 IFBench 上领先,却在 SWE-bench Pro 和 Humanity's Last Exam 上落后;其推理努力程度量表——低、中、超高——与 OpenAI 的六级量表之间没有直接对应关系。以超高等级发布的分数,与以中等等级发布的分数并非同一回事,而两家厂商都没有在对比图表上标明某个具体数字究竟出自哪一档。

说到底,这就是为什么在这里不该依赖任何一家厂商的表格。阿里巴巴的数字是在阿里巴巴自己的测试框架上、按自己的推理强度设置跑出来的;OpenAI 的数字则是在 OpenAI 自己的那套上跑出来的。Artificial Analysis 的数据之所以存在,正是因为那两者都无法用来做正面对比,而上文引用的正是它的数据。

可复现性是一项实实在在的功能,而它的价格为零

带日期标记的快照是这次对比中最被低估的一项。Qwen3.8-Max-0902 是一个锁定于 2026 年 9 月 2 日的修订版本,阿里巴巴称它具备与基础模型相同的能力和定价。将它固定下来,意味着你端点背后的模型不会在你不知不觉间,从周二到周四就换了个样。

GPT-6 Sol 没有对应版本。它是一个单一的滚动标识符——同一个模型页面只提供一个默认快照,没有带日期的变体——这意味着你九月做基准测试的东西,并不保证就是你十一月调用的东西。对大多数团队来说,这没问题。但对于必须证明某个输出由什么生成的受监管流水线而言,这是实打实的差异,而且这是 Alibaba 免费提供的,OpenAI 却完全不提供。

视频线才是起决定作用的那一条。

以上所有内容都是对比。这部分不是。如果你的输入包含视频——屏幕录制、检查录像、课堂录制,任何信息处于动态而非静止画面中的内容——Qwen3.8-Max 可以原生接受它,而 GPT-6 Sol 没有通往它的路径。你无法靠提示词绕过一种模态。你无法把视频预处理成图像并获得同样的东西,因为时间信息才是关键,而文本基准上的再多指标分数也无法替代你的任务实际所需的输入。

反过来那种情况也值得点明,因为正是在这种情况下,比较才不再是一边倒。如果你的输入是文本和图像,Sol 每项任务的成本更低,在中立榜单上领先四个点,缓存读取也更便宜。视频能力并不是对你有利的决胜项;它只是压根没被用上。

路由具有两个独立答案的决策

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

在这种情况下,正确的架构确实应该是两个模型,而不是一个,原因在于这种划分依据的是输入模态,而不是难度。一条既接收视频又基于文本进行推理的流水线两者都需要,而路由规则是请求本身的一项属性,而不是靠主观判断来决定的事情。

Qwen3.8-Max 已收录于 OrcaRouter 的目录 — 带日期的 qwen/qwen3.8-max-0902 快照可路由,按直通模式采用阿里巴巴的标价,这意味着阿里巴巴的价格变动当天即在我们这边生效,而无需等经销商重新议价。截至本文撰写时,GPT-6 Sol 尚未收录于我们的目录,可通过 OpenAI 自有 API 访问。路由 DSL 正是契合这一具体场景的一环:将携带视频的请求发往一处、其余请求发往另一处的规则正是它的用武之地,而自动故障转移意味着模态分支不会成为单点故障。

每个的优势所在

• 视频输入,文本输出——Qwen3.8-Max,无可匹敌。

• 可输入文本和图像,以每完成任务的成本作为衡量指标——在独立测试框架上,GPT-6 Sol 大约领先五倍。

• 缓存前缀处理 — GPT-6 Sol。其缓存读取略便宜,且 token 量不到一半。

• 输入 token 超过 272,000 的请求 — Qwen3.8-Max。Sol 的整请求重新计价是本次对比中单项最大的成本差异,而且在标称费率上根本看不出来。

• 可复现的版本固定 — Qwen3.8-Max-0902,不产生任何额外费用,且是两者中唯一被固定的版本。

• 如果你看到一张图表显示 Qwen 在 SWE-bench Pro 上领先——先查清它是由谁的测试框架跑出来的,以及是在哪个努力程度设置下得出的。独立榜单的综合评分中 Qwen 落后三分,而且各家厂商的表格彼此并不在同一尺度上。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新