
GPT-6 Astra 对比 Qwen3.8-Max:两大智能体旗舰及各自的细则
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
2026年9月有两则"智能体旗舰"的报道,主角分别是GPT-6 Astra和Qwen3.8-Max。OpenAI于9月3日发布GPT-6 Astra,称其为全球在计算机使用、软件工程、科学和网络安全方面最强的模型;阿里巴巴的Qwen3.8-Max自8月3日推出以来,一直是中国最强实验室的智能体旗舰——Artificial Analysis在智能体指数中将其列为业界顶尖,它也是开放生态系统中对前沿模型自主工作主张最有力的挑战者。两款模型确实都很强,且宣传时的头条数字却经不起细究:OpenAI在ARC-AGI-3上99.9%的成绩,在ARC Prize使用自己的中立测试框架复测后降至62.7%;Qwen3.8-Max的智能体表现虽然出色,但独立测评显示其幻觉问题出现回退,并且它习惯于在前代只需14轮就能完成的任务上花费64轮、超过一美元。这是对两款模型的比较——也是对两种基准解读方式的比较。
这两个标题
OpenAI 为 GPT-6 Astra 提出的卖点是广度加自主性:一个模型即可驱动浏览器、编写并修复代码、运行科学分析,而且——独特之处在于——它能发现新的安全漏洞,能力之强让 OpenAI 依据其“预备框架”(Preparedness Framework)将整个模型评为“严重”(critical)级别,并将最高能力设置仅限经审核的合作伙伴使用。发布材料声称,该模型在 ExploitBench 上取得满分 100%,在 FrontierMath Tier 4 上取得 97.6%,在 GPQA Diamond 上取得 96.0%,并拿下 ARC-AGI-3 的饱和分数。阿里巴巴对 Qwen3.8-Max 的卖点则更聚焦但同样犀利:一款定价 $2/$6 的智能体“主力干将”,在独立的智能体评测中位居前列或接近榜首,底层权重以自定义许可证公开发布,而非锁在黑匣子里。
独立记分牌显示的内容
Artificial Analysis目前将GPT-6 Astra(max)的智能得分评为61——在其追踪的202个模型中排名第8——Qwen3.8-Max的智能得分为58,排名第24。这三分的差距小于价格差距,也小于两家厂商各自营销所暗示的差距;在AA单独的智能体指数上,Qwen3.8-Max以58分与专有前沿模型中的最强者持平,而AA至今根本没有为GPT-6 Astra发布智能体指数。诚实的解读是:就纯实测智能而言,这两者是近邻,OpenAI发布材料中“全世界最智能的模型”的表述,并不是AA独立评测所展现的结果。
• 智能 — GPT-6 Astra (max):AA Intelligence 61,排名 #8/202。Qwen3.8-Max:AA Intelligence 58,排名 #24/202;AA Agentic 58。
• 标价 — GPT-6 Astra:每1M $10.00 / $50.00,缓存读取 $1.00,超过272K token的输入按2倍计费。Qwen3.8-Max:每1M $2.00 / $6.00,缓存读取 $0.25。
• 上下文 / 输出——GPT-6 Astra:1.05M 输入 / 128K 输出。Qwen3.8-Max:1M 输入 / ~128K 输出。
• 智能体证据——GPT-6 Astra:ARC-AGI-3 达 99.9%(OpenAI 评估框架)对比 62.7%(ARC Prize 标准评估框架);WANDR 0.682,每次任务 $11.98(Perplexity 报告)。Qwen3.8-Max:AA GDPval 在每次任务 64 轮下 Elo 达 1,739(约 $1.14/任务);Code Arena WebDev 以 Elo 1,691 位列第一。
• 独立危险信号GPT-6 Astra:尚未进入 ChatGPT 的模型选择器,API 分阶段推出,且在可监控性上作出让步。Qwen3.8-Max:与上一代相比,AA-Omniscience 幻觉率从 23% 恶化至 40%。
• 权重——GPT-6 Astra:专有。Qwen3.8-Max:Max 级检查点(Qwen3.8-2.4T-A95B),自8月12日起以自定义许可证公开;AA 仍将托管的旗舰模型列为专有。

细则注释
先看 ARC-AGI-3 的数字,因为它最能说明一个数字如何既真实又具有误导性。OpenAI 在其自家的 provider-adapter 测试框架上报告 GPT-6 Astra 达到 99.9%——这是针对该模型调整过的设置。ARC Prize,即维护该基准测试的组织,在提供商中立的标准化测试框架上运行 GPT-6 Astra,测得 62.7%。两者都是当前最先进的水平;但都不是在模型制造商无法控制的测试框架上取得的 99.9%。同样的谨慎也适用于 Perplexity 的 WANDR 得分 0.682——这是 Perplexity 记录的最高分,但测量方是一家同时将 GPT-6 Astra 集成到自有产品的公司,因此带有商业利益。这种模式值得点名:OpenAI 最耀眼的数字全部来自 OpenAI 或其合作伙伴控制的测试框架,而唯一完全独立的数字——AA 的 Intelligence 61——仅仅是“优秀”而已。
Qwen3.8-Max 的细则所揭示的情况恰恰相反:它的优势是独立测得的,它的弱点也是独立测得的。GDPval 的 1,739 Elo 分数是真实的——但 Artificial Analysis 的运行显示,Qwen3.8-Max 达到这一分数需要花费 64 轮和每项任务约 1.14 美元,而前一代只需要 14 轮和 0.53 美元。这就是一种“努力税”:该模型用推理 token 来换取其智能体能力上限,这对任何按 token 付费的人都很重要。此外,AA 的 Omniscience 评估测得其幻觉率相对于前一代 Qwen 从 23% 恶化到 40%——这是一个真实的独立警示,恰恰指向那些自主、多步骤的工作负载,在这些场景中,自信的错误答案代价最为高昂。一个在 64 轮中把自己绕进错误的模型,与一个其制造者承认可监控性已经下降的模型相比,释放出去并不显然更安全。

价格、部署与诚实的选择方式
在价格上毫无悬念:Qwen3.8-Max 每百万 token 输入价 2.00 美元、输出价 6.00 美元,仅为 GPT-6 Astra 输入价的五分之一、输出价的八分之一;还提供 100 万 token 的上下文窗口,且不像 Astra 那样收取长提示附加费。在可部署性上,Qwen3.8-Max 本周还有另一项优势——今天即可调用,而且它已按 Alibaba 的官方标价在 OrcaRouter 上线,以 0% 加价直通并带自动故障转移。GPT-6 Astra 仍在逐步推出,截至 9 月 4 日,多数用户还不能在 ChatGPT 中选用;不过它已可通过 OpenAI 自己的 API 以及各大云市场访问,而且开放范围还在扩大。对于构建 agentic 管线的团队,务实的做法是:把工作负载放到今天就能调用的模型上,把另一个当作持续观察的基准。如果你想验证“agentic”的说法,而不是照单全收,路由层就是合适的工具:在 OrcaRouter 上,Qwen3.8-Max、Kimi K3、Grok 4.6 以及另外 200 多个模型都只需同一个 key 即可访问,并且这套路由 DSL 可以把其中多个模型编排成一次调用——这样,你就可以在这些候选模型上运行自己的任务套件,亲自读取结果,而不必在两个厂商的细则之间做选择。
这场对决不断提出的两个问题
为什么OpenAI报告{{1}}ARC-AGI-3上的99.9%{{/1}},而ARC Prize却测得{{2}}62.7%{{/2}}?因为它们并不是同一个测试。{{3}}OpenAI的provider-adapter评测框架是按GPT-6 Astra在生产环境中的调用方式来配置的基准测试版本{{/3}};{{4}}ARC Prize的标准评测框架则是为了公平比较任何模型而设计的中性配置{{/4}}。而{{5}}62.7%{{/5}}才是能泛化到{{6}}“如果我自己调用这个模型会怎样”{{/6}}的那个结果,而且它仍然是{{7}}ARC Prize在该评测框架上记录到的最佳成绩{{/7}}。
Qwen3.8-Max 是开放权重的吗?部分是,但带有许可限制。阿里巴巴于 8 月 12 日以自定义许可证发布了 Max 级检查点 Qwen3.8-2.4T-A95B——权重可下载,但它并不像较小的 Qwen3.8-27B 那样具备 Apache-2.0 式的开放性,而且 Artificial Analysis 仍将托管的旗舰型号列为专有。如果你的要求是“能运行我付费购买的那款确切模型”,那么这种区别就很重要;如果你的要求是“能检查架构并自行托管一个相近的变体”,那么 Qwen3.8-Max 符合条件,而 GPT-6 Astra 则不符合。
要点
如果你需要的是 GPT-6 Astra 目前独有的东西——攻击性安全工作、前沿科学推理、最难完成的自主计算机使用任务——并且你的组织能通过它的门槛审查、承担得起它的价格,那就选 GPT-6 Astra。如果你想要一个真正能在这周以 $2/$6 部署的顶级智能体模型,那就选 Qwen3.8-Max:权重就是一条退路,另外还有一个你现在已经知道要测的幻觉回退。更深一层的教训恰恰藏在细则里:2026 年 9 月,两款领先的“智能体”旗舰产品,标榜的核心数字都不是哪家厂商能完全掌控的;理性的买家会读懂评测框架、数清轮数,在选边之前先跑一遍自己的任务。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
