
GPT-6 Luna 对比 Qwen3.8-Max:本次对比中最便宜的模型,也是唯一能观看视频的模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
对这对组合来说,最显而易见的解读框架恰恰是错的。 Qwen3.8-Max标价为每百万输入 token 2.00 美元、每百万输出 6.00 美元,缓存读取 0.25 美元。 GPT-6 Luna标价为 0.10 美元和 0.50 美元,缓存读取仅 1 美分。输入贵二十倍,输出贵十二倍,缓存输入贵五十倍——价格差距如此之大,这场比较还没开始就已见分晓。
这件事尚未尘埃落定,因为这两个模型并不是在争夺同一个请求。Qwen3.8-Max 接受文本、图像和视频,其 131,072 个 token 的输出上限略高于 GPT-6 Luna 的 128,000。GPT-6 Luna 仅接受文本和图像。阿里巴巴的模型在独立的 Intelligence Index 上得分为 58——在智能体排行榜上位居其类别第一——而 GPT-6 Luna 在最大努力下得分为 37,默认设置下为 29。一个是拥有开放权重血统和视频输入模态的旗舰模型。另一个是走量层级,有着速度指标和每单位一美分的缓存费率。价格差距并不是对同一事物的折扣;它是对两种不同事物的描述。
这两个分别是什么
Qwen3.8-Max 是阿里巴巴 3.8 代旗舰,属于 Max 级检查点,其底层模型——Qwen3.8-2.4T-A95B——于 2026 年 8 月 12 日以自定义许可证公开发布,使其成为首个拥有开放权重的 Max 级 Qwen。托管版旗舰本身仍被独立委员会列为专有模型。它具备 1,000,000 token 上下文窗口、131,072 token 输出上限,支持文本、图像和视频输入,推理强度可选低、中、超高。同一价格下还提供固定版本 Qwen3.8-Max-0902,这个细节虽小,却具有切实的运营价值。
GPT-6 Luna 是 OpenAI 于 2026 年 9 月 22 日推出的效率层级,位于定价 $2.00/$10.00 的 GPT-6 Sol 和定价 $10.00/$50.00 的旗舰 GPT-6 Astra 之下。支持文本和图像输入、文本输出,上下文窗口为 1,050,000 个 token,最大输入为 922,000 个 token,输出上限为 128,000 个 token,effort 从 none 到 low、medium、high、xhigh 和 max,默认为 medium。闭源、单一标识符,任何拥有 API 密钥的人均可使用。
一个接受视频,并且可以以其基础形式下载。一个接受图像,而且速度快。两者的定价都是为了大规模使用。这两句话之间的重叠部分,比价格比所暗示的要小。
卡片,逐行
每个维度一行,每行均包含两侧:
• 每 100 万输入 — GPT-6 Luna $0.10 对比 Qwen3.8-Max $2.00
• 每 100 万 tokens 输出 — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00
• 每 1M 缓存输入 — 隐式缓存读取:GPT-6 Luna $0.01,Qwen3.8-Max $0.25;显式缓存读取 $0.17,显式缓存写入 $2.50
• 长上下文条款 —— GPT-6 Luna 在输入超过 272,000 个输入 token 时,将输入与缓存翻倍,并把输出提升至 1.5 倍,且适用于整个请求;相比之下,Qwen3.8-Max 在整个窗口内采用统一档位,这是 Qwen 方案唯一在结构上更优、而非仅仅是略便宜的地方
• 上下文窗口 — GPT-6 Luna 1,050,000 个 token,对比 Qwen3.8-Max 1,000,000 个 token
• 最大输出 — GPT-6 Luna 128,000 tokens,对比 Qwen3.8-Max 131,072 tokens
• 输入模态——GPT-6 Luna:文本和图像;对比 Qwen3.8-Max:文本、图像和视频
• 推理强度 — GPT-6 Luna 无、低、中(默认)、高、极高、最高 vs Qwen3.8-Max 低、中、超高
• 智能指数,独立评测 — GPT-6 Luna 在最高推理强度下 37 对比 Qwen3.8-Max 58
• Agentic Index,独立评估——Qwen3.8-Max 58 分,同类第一;尚无可比的 GPT-6 Luna 数据公布
• 默认投入得分 — GPT-6 Luna 29 在其默认中等档位下,对比 Qwen3.8-Max 在其最高档设置下测得的结果
• 每项 Index 任务成本(独立计算)——GPT-6 Luna 约 $0.07,而 Qwen3.8-Max 为 $5.41
• GDPval,独立评估——Qwen3.8-Max 在每任务 64 轮下达到 1,739 Elo,按该评估计算,相当于每完成一个任务约 1.14 美元;尚无可比的 GPT-6 Luna 运行结果公布
• AA-Omniscience 上的幻觉率——Qwen3.8-Max 为 40%,较上一代的 23% 有所回退;GPT-6 Luna 为 77%,低于此前的 93%
• 带日期的快照 —— GPT-6 Luna 是单一的滚动标识符,而 Qwen3.8-Max-0902 则以相同价格提供固定为 2026 年 9 月 2 日的修订版
• 权重 — GPT-6 Luna 闭源,仅提供 API;相比之下,Qwen3.8-Max 的基座 Qwen3.8-2.4T-A95B 检查点自 2026 年 8 月 12 日起以自定义许可证公开,而其托管旗舰版则被列为专有。
• 在 OrcaRouter 上 —— GPT-6 Luna 不在我们的目录中,而 Qwen3.8-Max 可按阿里巴巴的标价路由

视频不是一个功能线,而是一种不同的工作负载
模态行比价格行决定了更多真实的比较,而且它通常被解读为复选框。
Qwen3.8-Max 支持视频输入。GPT-6 Luna 则不支持。如果你的流水线需要理解屏幕录制、产品演示、课程录像、监控摄像头片段或 UI 操作演示,那么比较到这一行就结束了,二十倍的价格差也变得无关紧要——你不是在昂贵选项和便宜选项之间做选择,而是在有选项和没有选项之间做选择。抽取关键帧并以图像形式传入只是一种变通做法,而非等效方案;任何实际搭建过这种方案的人都清楚,它在成本和质量上都存在差距。
如果你的流水线处理的是文本和图像,那么模态这条线是沉默的,而价格这条线则在发声。这是诚实的划分,在阅读本页其他任何内容之前,值得直截了当地说明你站在哪一边。
智能体能力差距确实存在,而且它是价格差异中昂贵的那一半。
Qwen3.8-Max 在独立的 Intelligence Index 上得分 58。GPT-6 Luna 在最大努力下得分 37,在其默认中等设置下得分 29。在匹配设置下相差二十一分,在默认设置下相差二十九分——在一个单点差异都处于重跑噪声范围内的综合指标上,这样的差距绝非噪声。
{{1}}Qwen3.8-Max{{/1}} 的定位集中于智能体工作。它在独立的 {{2}}Agentic Index{{/2}} 上得分 58,位列同类第一,并在 {{3}}GDPval{{/3}} 上以每任务 64 轮对话取得 1,739 Elo。最后这个数字才是真正说明问题的数字,因为它衡量的是一个模型在连续六十四次决策中始终保持任务连贯性的能力,而且它还附带一个价格标签:在那项评估中,每完成一个任务大约需要 $1.14。将其与 {{4}}GPT-6 Luna{{/4}} 每项指数任务约 $0.07 的成本相比,诚实的说法并不是 Qwen 很贵。而是 Qwen 被要求做一件难得多的事,并且做到了。
推论是,GPT-6 Luna 的二十一点差距在你的工作负载中也并非均匀分布。在一项简短、规格明确、由程序消费的任务上——提取这个字段、对这张工单进行分类、路由这个请求——两个模型几乎总能在所有时候给出同样可用的答案,而指数差距在你的评估中将不可见。在一项需要六十四个连续动作并在末尾设有检查点的任务上,这一差距就是完成与悄悄半途而废之间的差别,而这正是 Qwen3.8-Max 专为打造、GPT-6 Luna 并非如此的任务。
有一个数字却指向相反的方向,值得明说,而不是被掩埋。Qwen3.8-Max 在 omniscience 榜单上的幻觉率为 40%,高于上一代的 23%——这是一次大幅退步,而且是在生产环境中以自信满满的错误答案、而非以一行基准测试成绩的形式显现出来的那种退步。GPT-6 Luna 的幻觉率则为 77%,低于此前的 93%。从绝对值看,两个数字都偏高,而在这项指标上,更便宜的那款模型仍是两者中更差的一个。这两个数字都不是偏好某一款模型的理由;两者都说明,凡是捏造事实代价高昂的场合,都应当让人或验证器留在流程之中。
长上下文条款是Qwen在结构上胜出的唯一一项
GPT-6 Luna 带有一项 Qwen3.8-Max 没有的条款:输入 token 超过 272,000 的请求,其输入和缓存费率按两倍计费,输出费率按 1.5 倍计费,且适用于整个请求,而不是仅适用于超出的那部分。在 GPT-6 Luna 上发起一次 300,000 token 的调用,全部 300,000 个 token 都按每百万输入 $0.20 计费,因为它超出了 28,000。把同一份文档拆成两次调用,提示词不用做任何改动,成本就能减半。
Qwen3.8-Max 在其完整的 1,000,000 token 窗口内保持统一价格。对于真正庞大的单次请求,这使得十二倍的输出价格差距看起来比实际更小,甚至可能反转:当输入超过 272,000 token 时,GPT-6 Luna 的有效输入费率翻倍至 $0.20,输出费率升至 $0.75,而 Qwen 则维持在 $2.00 和 $6.00 的统一价格。输入端的差距从二十倍缩小到十倍,输出端从十二倍缩小到八倍。差距依然很大——但最有可能拥有 300,000 token 工作上下文的,恰恰是两家厂商都在争取的智能体类负载,而运行这些负载的团队正是会注意到这一点的那些团队。
另一条结构性条目是固定版本。Qwen3.8-Max-0902 与滚动标识符同价,这意味着需要跨模型更新保持可复现行为的团队无需支付溢价就能获得它。GPT-6 Luna 没有提供对等方案。这在价目表上只是一小行,在事后复盘中却是一大行。
运行其中一个,或两个都运行
Qwen3.8-Max 已在 OrcaRouter 上线,价格与阿里巴巴的官方标价一致;在成本直通的定价方式下,这意味着供应商一旦调价,我们这边当天就会生效。我们的路由层有两点为这款特定模型赢得了用武之地:自动故障转移,因为一个拥有公开开放权重基座的托管旗舰模型,其上游供应商比封闭的单一厂商模型更多,其中某一家出现性能劣化的可能途径也更多;以及固定修订版本的处理机制,它让某条路由可以明确锁定 Qwen3.8-Max-0902,而不是被动继承那个滚动标识符下周解析出的版本。
截至本文撰写时,GPT-6 Luna 尚未收录在我们的目录中,只能通过 OpenAI 自家的 API 访问,因此想要同时使用两者的团队,需要在原有用于 OpenAI 的密钥之外,再为 Qwen3.8-Max 配置一个密钥。这同样是这样一种组合:路由 DSL 比静态分流更有价值,因为这两个模型之间的分界线是模态检查和长度检查,而非偏好:携带视频的请求会发往 Qwen3.8-Max,因为其他模型无法处理;输入 token 超过 272,000 的请求会发往 Qwen3.8-Max,因为另一个模型在此处的价格断崖会让这些请求变得更贵;其余所有请求则发往价格只有其二十分之一的那个模型。这是一条规则,应当放在配置中,而不是应用代码的分支里。

哪一个,什么时候
如果以下任一情况成立,就选择 Qwen3.8-Max。你的流水线需要视频输入。你的请求经常超过 272,000 个输入 token,在这种情况下,其统一费率档位胜过 GPT-6 Luna 的重新定价。你的输出超过 128,000 个 token。你的工作是具有可验证终点的长时程智能体执行,此时,它在智能体榜单上的 58 分,以及在每任务 64 轮下 GDPval 上 1,739 的 Elo,才是真正重要的证据。或者你需要一个固定修订版以保证可复现性,并且愿意为此付费——而在与滚动标识同价的情况下,这意味着你并不愿意。
如果以上情况都不适用,而你的工作负载属于高并发、由程序消费、图文并重且内容简短,那就选 GPT-6 Luna。分类、抽取、路由、批量摘要,以及需要快速而非审慎回答的智能体内循环。价格为 $0.10/$0.50,缓存读取为一美分,每完成一项任务的成本约为 Qwen3.8-Max 的十五分之一,这笔账根本不用细算。请显式设置 effort 参数——默认值为 medium,而宣传中的 37 是最大 effort 的数值——并让长调用保持在 272,000 token 这条线的右侧。
这种比较容易引发的错误,是把二十倍的输入价格当成一纸定论。它只是对某一种工作负载形态的定论,而对决定另一种形态的三条判据却只字未提:请求是否携带视频,是否超过 272,000 个 token,以及答案是否必须经得起六十四步连续推理。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
