
GPT-6 vs Qwen 3.8 Max:一个处理视频,一个写得更长
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
GPT-6 Sol与Qwen3.8 Max的输入价格相同——均为每百万 tokens 2.00 美元——但随后在两个方面出现分化,而单看价格表是看不出这两点的。Qwen3.8 Max自 2026 年 8 月 3 日起正式开放服务(general availability),是两者中唯一接受视频的模型:其输入模态为文本、图像和视频,而 GPT-6 Sol 则接受文本、图像和文件。GPT-6 Sol由厂商于 2026 年 9 月 22 日发布,是两者中唯一公布了输出上限的模型——128,000 tokens——也是唯一拥有面向消费者入口的模型:10 月 7 日 ChatGPT 的上线推送将该模型呈现在超过 12 亿周活跃用户面前。
所以,排序问题不在于哪个更强,而在于你的输入是不是视频,以及你的输出是不是很长。
视频是岔路口
大多数模型对比最终都归结为价格和基准测试,而这一次存在一个硬性的结构性差异,使这些对比指标沦为次要。如果你的数据处理流水线需要摄入视频——监控录像、会议录制、体育或讲座素材、产品演示片——Qwen3.8 Max 可以把视频片段直接放进请求中。它的模型卡将视频列为与文本和图像并列的输入模态,最高可达百万 token 的上下文窗口,这对视频来说意味着在一次调用中完成帧采样加转写,而不是单独的提取阶段。GPT-6 Sol 做不到。它的模态是文本、图像和文件;模型卡上没有视频输入,再多提示工程也无法替代它。
那一行决定了视频流水线的候选名单,而它并不会出现在报价单上。这两个模型真正可以互换的地方在于文本和图像任务,下文的价格与基准对比也正是针对这一点。
关于视频能力的坦诚说明:模态是有文档记录的,但 schema 没有。两家厂商的产品目录条目都没有明确说明分辨率、帧率或片段长度限制,所以“支持视频”意味着输入类型存在,并不意味着任何特定片段都会以你所需的质量被摄取。在基于它构建之前,请用你自己的素材进行测试。
输出侧则朝相反方向运行
把请求反过来看,优势就发生了逆转。GPT-6 Sol 公布的最大输出为每次响应 128,000 个 token。Qwen3.8 Max 的卡片公布了上下文窗口,却没有公布最大输出数值,因此一个要依据硬性输出上限来做预算的系统,无法从厂商的数据中直接读出这一数字——同样的缺口也出现在若干托管平台的卡片上,值得将其视为未知,而非无限。
已公布的是输出侧的价格不对称,而且它与视频中的说法正好相反。Qwen3.8 Max 每百万输出 token 收费 6.00 美元,而 GPT-6 Sol 为 10.00 美元——模型每写一个 token 都便宜 40%。对于输出密集型的工作负载,例如长文本生成或序列化大型结构化产物,Qwen3.8 Max 在单位工作量上的成本明显更低,而这一点与输入价格是否相同无关。
另请注意,Qwen3.8 Max 的模型卡只列出了一个输入费率,没有记录长上下文分级,而 GPT-6 Sol 在输入 token 超过 272,000 时,会对整个请求重新定价为输入 $4.00、输出 $15.00。OpenAI 的模型页面明确说明了该规则:超过该阈值的提示,整个请求按输入和缓存费率的 2 倍、输出费率的 1.5 倍计费。当提示超过 272,000 个 token 时,GPT-6 Sol 的有效输入费率翻倍至 $4.00,而 Qwen3.8 Max 的仍为 $2.00——再次逆转了表面上的输入费率持平。
独立董事会怎么说
Artificial Analysis 同时收录了这两个模型,综合指数显示 GPT-6 Sol 领先,而多项单项测试却恰恰相反。下文中的每一个数字都来自评估方,而非厂商。
• 智能指数:GPT-6 Sol 47.6,Qwen3.8 Max 45.4 —— GPT-6 Sol 领先约两点
• 编程指数:Qwen3.8 Max 76.2,位列前十;GPT-6 Sol 的编程表现与之相当,但 Qwen 的排名更高
• GPQA Diamond:Qwen3.8 Max 92.8%,在同一测试系列中 GPT-6 Sol 的数值更高
• Humanity's Last Exam:Qwen3.8 Max 43.1%,GPT-6 Sol 47.9%
• 长上下文召回:Qwen3.8 Max 80.3%,GPT-6 Sol 83.7%
• SciCode:Qwen3.8 Max 52.1%,GPT-6 Sol 57.6%
• 智能体工具使用:Qwen3.8 Max 在 terminal-bench v2.1 上为 88.8%,在 tau-banking 上为 47.8%,两项均表现强劲
规律是:GPT-6 Sol 在综合通用推理以及科学知识与回忆类测试中胜出,而 Qwen3.8 Max 则是编程和工具使用方面更敏锐的模型。有两点需要注意,而且它们并非可有可无。第一,这些指数值是在不同日期评测的,因此两次修订之间相差两个点,仍处于重跑所产生的波动范围内,并不是一个确定的差距。第二,Qwen3.8 Max 公布的数值是评测方在由阿里巴巴端点所提供服务的模型上运行的结果,而厂商还在 2026 年 9 月 2 日以相同的 $2.00 / $6.00 费率发布了一个带日期的快照 Qwen3.8 Max (0902)——如果你要固定使用某个快照,在引用分数之前,先确认你调用的是哪一个。

OpenAI 10月7日发布新增了什么
ChatGPT 的这次发布是分发层面的事实,而非能力层面的事实,但它改变了读者所说的“GPT-6”的含义。2026 年 10 月 7 日,OpenAI 开始在 Intelligent UI 能力下将 GPT-6 逐步推入 ChatGPT,其中 Chat 标签页率先覆盖 Plus、Pro、Business 和 Enterprise,Free 和 Go 则从 10 月 8 日起跟进;企业版可用性取决于工作区管理员设置。为 Work 和 Codex 提供支持的模型保持不变。
有两个细节对这项比较很重要。ChatGPT 体验在付费消费者层级由 GPT-6 Sol 驱动——所以十亿多人接触到的 GPT-6,就是你通过 API 调用的同一个模型,而不是一个单独的检查点。而且 GPT-6 是一个系列,而非单一模型:GPT-6 Astra 位于 Sol 之上,价格为 $10.00 / $50.00;GPT-6 Luna 则位于其下,价格为 $0.10 / $0.50。当某项比较提到“GPT-6”与 Qwen3.8 Max 对比,却没有说明是哪个层级时,通常默认是与 Sol 比较;而当它想拿出最强的论据时,则是与 Astra 比较。点明层级,就是公正比较与修辞性比较之间的区别。
成本,按形状而非比率来衡量
由于输入费率相同,而输出费率存在差异,最终哪一方胜出完全取决于输入 token 与输出 token 的比例。按各供应商公布的费率计算,且不包括缓存:
• 视频与转录文本分析(500K 输入,6K 输出):Qwen3.8 Max ≈ $1.04,GPT-6 Sol 不适用——不支持视频输入
• 文档分析(250K 输入,5K 输出):Qwen3.8 Max ≈ $0.53,GPT-6 Sol 在其 272 阈值生效前约为 $0.55,而一旦整个请求重新计价则会更高
• 长篇生成(40K 输入,80K 输出):Qwen3.8 Max ≈ $0.56,GPT-6 Sol ≈ $0.88
• 均衡型智能体循环(60K 输入,20K 输出):Qwen3.8 Max ≈ $0.24,GPT-6 Sol ≈ $0.32
结果的格局是稳定的:在相同的 token 组合下,Qwen3.8 Max 是更便宜的模型,因为两者的输入费率持平,而它的输出费率更低。GPT-6 Sol 的反驳理由根本不在价格上——而在于推理综合评分、消费端验证,以及一个有据可查、让预算编制变得简单直接的输出上限。
有一个值得说明的运营注意事项,因为模型卡片并未提及。根据 2026 年 10 月第一周在 OrcaRouter 的 playground 上进行的测量,Qwen3.8 Max 路线的首 token 延迟中位数约为 5,809 毫秒,输出速度约为每秒 50 个 token,错误率较低;同一时间窗口内,GPT-6 Sol 路线的吞吐量测得更高,但错误率也明显更高。这些都是共享路线的观测结果,并非供应商 SLA,而且每周都会变化——这正是应当衡量你自己的流量,而不是相信任一模型卡片的理由。
将两者运行在一个密钥下
对于一侧做视频工作、另一侧做大量推理工作的团队来说,现实答案是:两个模型都不会直接胜出,两者都该留在技术栈里。这正是网关的用武之地。在 OrcaRouter 上,qwen/qwen3.8-max 和 GPT-6 Sol 都是同一目录中的实时路由,统一在一个兼容 OpenAI 的 API 之后,按供应商标价、零加价——因此阿里或 OpenAI 一旦调价,当天就能传导到你这里,而不必等到下次核对账单时才发现,也无需为每个供应商分别准备凭证或 SDK 路径。
有两个功能在这里发挥着具体作用。自动故障转移能在某个提供商的路由劣化时让流水线继续存活,而鉴于那两条路由在同一测量窗口中的表现差异如此之大,这一点直接关乎成败。而路由 DSL 让请求自己说了算:把任何携带视频输入的请求发给 Qwen3.8 Max,把长上下文推理任务发给 GPT-6 Sol,并让基于输入模态和请求大小的谓词来做出选择,而不是依赖一个硬编码的模型 ID——一旦流量发生变化,它就得靠人工修改。

简短版本:如果你的输入包含视频,那么 Qwen3.8 Max 是两者中唯一能接收视频的模型,而且一旦你有了请求,它在每一种 token 组合下都是更便宜的那个。如果你的工作是文本与图像推理,需要长而有界的输出以及一个经过验证的消费级默认选项,那么 GPT-6 Sol 在综合指数上是更强的一张牌,也是那个有明确文档化输出上限的模型。在两者都需要的场景下,就做路由——让请求的模态成为路由键,而不是发布周期。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
