
Gemini 3.1 Pro 与 Qwen3.8-27B:提前七个月的预览 vs 一个可下载的检查点
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月18日,该厂商自家 AI 开发者论坛上的用户开始报告,Gemini 3.1 Pro已从 AI Studio 的模型选择器中消失——付费账户也不例外,清缓存、开无痕窗口都无济于事。那个要求厂商说明这究竟是“bug 还是有意为之”的帖子,到9月21日仍挂着。没有弃用通知,没有迁移路径,也没有官方人员回复。与此同时,Qwen3.8-27B——该实验室于8月14日以 Apache 2.0 协议开源——任何已经下载它的人都无法被夺走。这场对决真正取决于的,正是这种不对称,而非基准测试的差距(差距确实存在,但并不算大);也正因如此,尽管各种对比表格把这两个模型并排放在一起,它们其实并不在争夺同一个位置。
以下是对现有数据的一一对比,每项均标明来源:Artificial Analysis 于 2026 年 9 月 23 日抓取的数值、阿里巴巴自家的模型卡、Google 的发布公告,以及我们自己的路由遥测数据,全程分开呈现。凡未经测量之处,本页会如实说明,而非凭空猜测。
本周发生了什么,以及它意味着什么、不意味着什么
这些报告很具体,而且来自 Google 自己的论坛,而不是竞争对手的博客。一个题为“Gemini 3.1 Pro 自 2026-09-18 起从 AI Studio 中消失——是 bug 还是有意为之?”的帖子描述了付费用户在没有任何公告的情况下失去该模型、Google One 支持提供无关的故障排除步骤,以及 Google 状态页面显示没有任何问题。第二个帖子“Gemini 3.1 Pro Preview 模型无法在 AI Studio 中用于构建 App”,收集了同样的投诉,其中包括一位用户的编程助手已基于该预览版构建了数月,而他说 Flash 在其代码库上“制造垃圾”。
三点坦率的提醒。这是开发者控制台中的消失,而非已确认的 API 中断:Gemini 3.1 Pro 在我们自己的目录中仍被列出、仍可路由调用,过去七天里它流转了 9470 万个 token。这属于用户报告——谷歌一言未发,因此在谷歌之外,没人能把“悄然弃用”与“容量问题”和“控制台缺陷”区分开来。而且这个时间点也谈不上体面,毕竟该模型自 2026 年 2 月 19 日起就一直处于预览状态——整整七个月,没有公布任何 GA 日期,而谷歌却在它下面接连推出了一整梯队 Flash 模型。另外,GitHub Copilot 已于 2026 年 9 月 1 日停用 Gemini 3.1 Pro,并提前 30 天通知;这是一起不同且无关的事件,但指向同一个方向:一个没有 GA 承诺的预览端点,是一种你有理由为之忐忑的依赖。
我们这边有一个数字值得与那个背景并列提一下,因为我们无法解释它,宁愿如实说明。我们对 Gemini 3.1 Pro 目录条目所做的七天遥测显示,错误率为 80.5%;而同一天上午我们检查的相邻模型——Qwen3.8-Max、Claude Fable 5.1——分别为 5.9% 和 6.9%。我们不知道这是否就是论坛所报告的那个问题,是某个上游提供商糟糕的一周,还是监测假象。请把它当作提交前先运行金丝雀测试的理由,而不是对模型的定论。
同一把尺子,两种分数
这是大多数对比页面都会弄错的部分,所以值得仔细处理。Artificial Analysis 在 Intelligence Index v4.3.2 上为这两个模型评分。我们在 2026 年 9 月 23 日抓取了两者的页面,并且两者都带有相同的修订版本——因此,与大多数跨模型指数说法不同,这一项是同一快照下的比较,差距是真实的。
• Qwen3.8-27B(xhigh)— 智能指数 33.7
• Gemini 3.1 Pro Preview — 智能指数 29.7
Qwen 在当前标尺上领先四分。更难的问题是这意味着什么,因为标尺本身今年至少已经变动了三次。二月,Artificial Analysis 发表了一篇文章,称 Gemini 3.1 Pro Preview 是“AI 领域的新领导者”,领先 Claude Opus 4.6 四分,当时的媒体报道称其在当时的 Index v4.0 上得分为 57。而在 v4.3.2 上,这个分数是 29.7。Artificial Analysis 于 2026 年 9 月 7 日宣布了 v4.3,距 v4.2 仅四天,这次修订用难度高得多的 66 项 Terminal-Bench 4.0 替换了 Terminal-Bench 2.1,并用 AutomationBench-AA 取代了 τ³-Banking。Gemini 3.1 Pro 在二月的优势,存在于新指数已取消或重新加权的那批评估中。所以:不是模型变差了,而是考试变了。但如果你今天要选模型,今天的数字才是你真正能据此行动的数字,而今天的数字青睐 Qwen。
两者真正产生分歧的地方
聚合分数会掩盖差异的形态,而形态才是有用的部分。以下每个数字都来自同一次 9 月 23 日抓取的 Artificial Analysis v4.3.2 页面,两个模型均取自同一版本。
• 推理与知识 — Gemini 明显领先。GPQA Diamond 94.1 对 90.5;Humanity's Last Exam 47.0 对 33.9;SciCode 58.7 对 46.6;CritPt 17.7 对 5.4。
• 真实世界的职业任务——Qwen 领先,且优势明显。GDPval 归一化得分 45.4% 对 13.8%。
• 智能体式银行业务与交易 —— Qwen 领先。τ-Banking 48.0,对比 Gemini 的 21.4。
• 通用基准上的智能体工具调用 — 在未测量 Qwen 的方面,Gemini 领先。Gemini 的 τ²-Bench 得分为 95.6;没有 Qwen3.8-27B 的数值。
• 终端工作——很接近,但两者在新基准上都很差。Terminal-Bench 2.1:Qwen 79.8,Gemini 73.8。Terminal-Bench 4.0:Qwen 5.6%,Gemini 4.0%——两者均为个位数。
• 校准——两页中差异最显著的一项。在 AA-Omniscience 上,Gemini 得分为 31.9,准确率为 54.9%,幻觉率为 50.9%;Qwen 得分为 −10.0,准确率为 15.6%,幻觉率为 30.3%。Gemini 知道得更多,但也有一半以上的时间是编造的;Qwen 经常拒绝回答,而在它确实回答的内容中,约三分之一会出现幻觉。
• 长上下文——在长上下文召回率上完全打平,各为 82.0。在多模态长上下文召回率上,Qwen 为 21.7%,Gemini 为 15.6%。
把“未测量”条目就按它们的本来面目来理解。Gemini 没有发布 GDPval-AA 归一化数值来对标 Qwen 的 45.4%,Qwen 也没有 τ²-Bench、IFBench、Terminal-Bench Hard 或 ITBench-SRE 的数值来对标 Gemini 的 77.1、53.8 和 30.3。那些空白中的每一处,都是汇总表原本会悄悄安插一个赢家的地方。

决定预算的分歧:运行索引的成本相同
Qwen3.8-27B 的每 token 成本要低得多。根据 Artificial Analysis 公布的市场数据,其输入价格为每百万 token 0.50 美元,输出价格为每百万 token 3.00 美元,缓存折扣为 80%,按 7:2:1 混合计算的费率为 0.47 美元。Gemini 3.1 Pro Preview 则分别为 2.00 美元和 12.00 美元——输入价格是前者的四倍,输出价格同样是四倍——缓存折扣为 90%,混合费率为 1.74 美元。
接下来是没人会印出来的那个数字:Artificial Analysis 自己的核算显示,运行整个 Intelligence Index 的成本为Gemini 3.1 Pro Preview 为 $1,310.21,Qwen3.8-27B 为 $1,335.92。Qwen 的运行成本并不更低。它反而略贵一点点,因为它花的时间更长才走到那一步。在 Qwen 的输出账单里,$512.36 花在了推理 token 上,而真正的回答只花了 $82.51;Gemini 这边,$691.82 花在推理上,回答则是 $113.08。按 token 计价是一个费率,而不是账单。
对比表里略去的另外两个定价事实。首先,Gemini 3.1 Pro 的价格按每次请求的输入规模分档:输入 token 不超过 20 万时为 2.00 美元/12.00 美元,超过之后则为4.00 美元/18.00 美元,而缓存读取费用从 0.20 美元翻倍至 0.40 美元。百万 token 的上下文窗口确实存在,但其中最后 80 万个 token 的成本要翻倍。其次,我们自己产品目录中 Qwen3.8-27B 的条目——以 block-FP8 提供服务,视觉塔采用全精度——标价为输入 0.40 美元、输出 4.21 美元,与上述市场数据相比,输入更便宜、输出更贵,而且完全没有公布缓存 token 费率。不同的提供商,不同的构成。请核对你实际将被计费的那档费率。
两个模型都可以通过一个 OrcaRouter 密钥按供应商目录价访问,加价 0%,因此供应商价格变动当天就会落到我们这边,而不是在重新定价周期之后——当两者之一在 200K tokens 处有一个层级边界时,这一点比平时更为重要。
延迟:最快的首个 token 属于较慢的模型
这是整个对比中最具误导性的一组数字,也是读者最有可能据此做出错误举动的一组。
• 首个分块时间——Qwen 4.04 秒,Gemini 28.37 秒。Qwen 看起来快了七倍。
• 到达实际答案的时间 — Gemini 28.37 秒 vs Qwen 52.52 秒。Gemini 大约以 1.8 倍的优势胜出,因为 Qwen 在首个数据块与首个答案 token 之间花了 48.48 秒进行思考。
• 输出速度——Gemini 每秒 116.5 个 token,而 Qwen 为 41.3 个。一旦开始生成,Gemini 的速度就是 Qwen 的 2.8 倍,而 Artificial Analysis 给出的对比基准中位数为每秒 95.4 个 token。Qwen 自己的页面也将其称为“明显缓慢”。
如果你的产品会向用户流式输出首个 token,那么 Qwen 主打的延迟数字就是一句你只会对自己说一次的谎言。如果你的产品要等完整答案到手才返回,那 Gemini 才是更快的模型。这两个数字都出自 Artificial Analysis 的实测;两者都是在 Qwen 的 xhigh effort 档位下测得的,而这正是模型卡的默认设置。
这个默认设置在从业者中一直广受诟病,而模型卡也半承认了这一点。Qwen3.8-27B 提供了一个 reasoning_effort 参数,包含三个级别——xhigh(默认值,“适用于需要深入分析的复杂任务”)、medium 和 low。截至九月的社区文章报告称,xhigh 会产生极长的思考阶段,并建议降至 medium 或 low,并限制推理预算。阿里巴巴自家的模型卡也提醒,在多轮智能体工作中,降低努力程度“并不总能缩短整体任务完成时间”——对模型卡而言,这是一句坦诚的话,也是一个警告:显而易见的修复方案并不总是真正的修复方案。
上下文:1M 对比 262K,以及实际能装下什么
Gemini 3.1 Pro 拥有 1,000,000 token 的上下文窗口,最大输出为 65,536 token。Qwen3.8-27B 原生支持 262,144 token,并可通过 YaRN 缩放扩展至 1,000,000,建议在其中分别分配预算:推理内容最多 262,144 token,最终响应最多 131,072 token。
两条诚实的脚注。Artificial Analysis 的规格表将 Qwen 的窗口列为 256,000,而其自己的 FAQ 文本写的是 260K,模型卡上写的则是 262,144——这些是同一个数字上的舍入差异,但请引用 262,144,因为模型卡上写的就是这个。而扩展到 1M 是一种缩放技术,与原生百万 token 窗口不是一回事:在 YaRN 扩展模型上的 1M 长上下文召回,并不是 82.0 AA-LCR 数值所衡量的内容。还没有人发布 Qwen3.8-27B 的 1M 上下文召回分数。把 Gemini 的窗口视为在完整长度下有实测行为的那一个,而把 Qwen 的窗口视为你在围绕它做设计之前应自行测试的那一个——并记住,当输入 token 超过 200K 后,Gemini 的价格会翻倍。
智能体工作与工具调用
这正是胜负真正难分之处,也是硬要造出一个赢家既容易又错误的地方。Qwen3.8-27B 拥有 Gemini 所缺乏的实测智能体分数,反之亦然。
Qwen 的理由建立在两个强劲的数字之上:一个是独立评测数字,一个是厂商自报数字。独立的数字是 τ-Banking 上的 48.0,而 Gemini 为 21.4——在同一版本上、在同一个关于银行环境中多步工具使用的基准上,高出一倍还多。厂商的数字是阿里巴巴自家的成绩单,其中列出 OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、CoWorkBench 70.7、JobBench 33.4 以及 Agents' Last Exam 20.4 Pass@1。这些是阿里巴巴自己的评测,没有任何其他人重新跑过,而它们恰好落在这样一些类别中:在这些类别里,独立测得的 GDPval 结果(归一化后 45.4% 对 13.8%)指向同一方向。
Gemini 的优势在于,它拥有对比中唯一一个绝对数值很高的智能体(agentic)分数——τ²-Bench 95.6——而 Qwen 完全没有 τ²-Bench 分数。它在指令遵循方面还有 IFBench 77.1,而 Qwen 这边同样是空白。并且它还有七个月的生产记录,而一个发布仅五周的开源权重版本并不具备这一点。
决胜因素不是分数,而是你的拓扑结构。Qwen 的智能体优势是在一些基准测试上衡量的,在这些测试中,模型要在它未曾设计的大型现有软件系统内部运行。Gemini 的则是在模型必须长时间精确遵循指令的基准测试上衡量的。这些是不同的技能,而且两者都是真实的。

编码
编程能力的分化也是如此,这就是为什么“谁更擅长代码”在这里没有明确的答案。Gemini 在科学计算这一端领先——SciCode 58.7 对 46.6——而它在我们的目录页上 68.8 的 AA Coding Index 与 Qwen 的 68.1 相差不到一个舍入误差,完全落在任何值得引用的置信区间之内。在智能体终端任务上,两者在较旧的基准测试中很接近,Terminal-Bench 2.1 上 Qwen 79.8 对 Gemini 73.8;而在更新的基准测试中则难以区分,两者都跌至个位数。
阿里巴巴的模型卡宣称的分数要高得多——SWE-bench Pro 61.7、LiveCodeBench v6 90.3、QwenSWEBench 79.0——但这些都属于厂商自报数据,而且模型卡脚注指出,SWE-bench Pro 和 QwenSWEBench 是在 Claude Code 测试框架中运行的,而竞争对手的数字不会使用这个框架。稳妥的说法是,在第三方对两家实验室的模型都测过的唯一一个编程基准上,两者在 Terminal-Bench 2.1 上相差 4 分,在 Terminal-Bench 4.0 上相差 1.6 分,而且两者在更难的那个基准上都表现糟糕。
开放权重与预览端点对比
这正是两者完全无法相提并论的一个维度,也是具有最大实际影响的一个。
Qwen3.8-27B 采用 Apache 2.0 许可,拥有 270 亿稠密参数、64 层,并以约 3:1 的比例混合了 Gated DeltaNet 线性注意力与全注意力——正是这种设计让 262K 窗口的部署变得可负担。它能跑起来。量化到 4 比特后,它大约占用 17GB,正好是一块消费级 GPU 的容量;五周之内,一整套压缩生态便围绕它生长起来,从 Unsloth 的 Dynamic V3 量化(其中包括一个 1 比特版本,Unsloth 称其能在 8GB 内运行,精度约为原版的 77%),到九月中旬 PrismML 的 Ternary Bonsai 2 27B。你可以对它进行微调,可以审计它,还可以在拔掉网线的笔记本上运行它。
Gemini 3.1 Pro 是一个封闭预览端点,已存在七个月,却没有正式发布(GA)日期;它的模型卡明确警告称,预览版可能不具备稳定版那样的稳定性、可用性和支持;而截至本周,它似乎已悄然退出了某个开发者控制台。你无法下载它,无法固定某个版本,也无法故障转移到你自己那里。
如果你想要的是诚实的路由答案,而不是一个裁决:开放检查点的存在,才让对 Gemini 的依赖变得可以承受。把 Qwen3.8-27B 放在本地或自托管路径后面作为回退,让 Gemini 3.1 Pro 留在主路径上,负责它可衡量地更擅长的重推理工作,并把两者都置于一个带自动故障转移的端点之后,这样,从别人的控制台里悄然消失,就会成为你的路由层所吸收的一起事件,而不是你的用户所看到的服务中断。这不是在为某个产品做推销——这是唯一一种配置,能让本周的新闻不让你付出一个周末的代价。
如果……请选择 Gemini 3.1 Pro
• 你最艰巨的工作是知识密集型推理,而非长时程工具使用——这使 GPQA Diamond 的成绩从 94.1 降至 90.5,Humanity's Last Exam 从 47.0 降至 33.9,SciCode 从 58.7 降至 46.6,CritPt 从 17.7 降至 5.4。
• 你需要真正超长的输入。一个经过实测的百万 token 窗口,其召回表现已在长上下文下得到验证,胜过靠技术手段扩展到 262K 的窗口——前提是你能接受输入超过 200K token 后价格翻倍。
• 完整回答的耗时比首个 token 的耗时更重要,而且你想要的是每秒 116.5 个 token,而不是 41.3 个。
• 如今你需要广泛的多模态能力:音频、文件、图像、文本和视频输入,以对应 Qwen 的文本、图像和视频。
• 你愿意接受预览风险,并且你有自己可控的回退方案。
如果……请选择 Qwen3.8-27B
你的智能体在现有大型系统内部运行——τ-Banking 的 48.0 到 21.4,以及归一化后的 GDPval 45.4% 到 13.8%,是本次比较中任何地方最大的两项单模型优势。
• 你需要一个诚实而非自信的答案。30.3% 的幻觉率,相较 Gemini 的 50.9%,是一种不同的产品。
• 许可或数据驻留规定排除了{{1}}闭源{{/1}} API,或者你需要基于自己的数据进行微调。
• 你希望每个 token 的账单只有 Gemini 的四分之一,并接受把省下来的差额花在思考 token 上——这个索引在两者上的运行成本相同。
• 你准备将 reasoning_effort 从默认的 xhigh 调低,而不是直接照原样发布。
我们无法验证的内容
必须说明的是,而且对比页面的价值恰恰取决于其留白之处:目前尚未发布针对 Qwen3.8-27B 在降低推理投入下的独立评测,因此它在中等和低档位下的速度与质量权衡尚无实测数据。对于经 YaRN 扩展的 1M 配置,也不存在长上下文召回分数。Gemini 3.1 Pro 没有已发布的 GDPval-AA 归一化分数,Qwen3.8-27B 也没有 τ²-Bench、IFBench 或 ITBench-SRE 的分数。而且没有人——包括 Google——说明过 Gemini 3.1 Pro 为何于 9 月 18 日从 AI Studio 选择器中消失。一旦上述任何一项发生变化,我们都会更新本页面。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
