一张"Qwen 4 Max vs Gemini 3.1 Pro"的主视觉标题卡,副标题为"未公布的旗舰对决永不落幕的预览版",三个胶囊形徽章分别写着"自 2026 年 2 月 19 日起预览"、"1,048,576 token 上下文"和"100 万 token 下 26.3% 检索率",页脚一行写着"阿里巴巴于 2026 年 9 月 22 日宣布;谷歌于 2026 年 2 月 19 日预览",右下角是 OrcaRouter 标志。
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro:未发布的旗舰对决永不落幕的预览版

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

大多数对比都是把一款已发布的产品与另一款已发布的产品放在一起较量。这一次却不同寻常:Qwen 4 Max 于 2026 年 9 月 22 日在杭州云栖大会上首次亮相预览,没有发布日期、没有价格,也没有权重;而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起便处于预览状态,七个月后的今天依然在预览——既未公布正式可用日期,其弃用表上也没有下线日期。这场对决中的两款模型,没有一个是已定型的产品。但这并不是跳过这场对比的理由。它本身就是这场对比,也是其中唯一真正具有信息价值的地方。

七个月的预览

预览标签本应是一种短暂状态。Gemini 3.1 Pro 如今历经同一实验室的三次 Flash 发布,仍一直保有这一标签,其中包括 2026 年 9 月 2 日发布的 Gemini 3.8 Flash,谷歌称其为最智能的 Flash 模型。在独立综合评测中,该模型现在的得分已高于 3.1 Pro。谷歌的 Pro 产品线没有更新的成员:不存在 Gemini 3.8 Pro,而 3.5 Pro 这一代曾被推迟,据报道已被搁置。实际结果是,带有 Pro 名称的模型不再是其自家厂商中得分最高的模型。

Google 在产品目录条目中自己给出的限制说明建议用户要为预览版的弃用做好规划,这才是解读该状态的诚实方式。一个既没有 GA 日期、也没有停用日期的预览版,是你可以基于它构建、却无法围绕它排期的模型。

Qwen 这一侧则是符号翻转后的镜像。Qwen 4 Max 并不处于长期预览中;它处于预览之前,什么都还没有发布。这两种失败模式正好相反:Gemini 3.1 Pro 是一个真实存在的端点,其长期存续情况未作说明;而 Qwen 4 Max 是一个已明确列出的路线图项目,却没有端点。

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

比较,以及决定它的长上下文数字

Gemini 3.1 Pro 的规格是公开且明确的。Qwen 4 Max 的则是空白。值得细细琢磨的是 Gemini 那一列中的一行,因为这是那种会被人引用、却不应该被引用的数字:

状态 — Gemini 3.1 Pro 自 2026 年 2 月 19 日起处于预览阶段,而 Qwen 4 Max 于 2026 年 9 月 22 日发布,但未公布具体日期

• 输入价格 — Gemini 3.1 Pro 在提示词不超过 200K 时为每 100 万 tokens 2.00 美元,超过则为 4.00 美元;相比之下,Qwen 4 Max 未公布

• 输出价格 — Gemini 3.1 Pro 每 1M 为 $12.00(200K 以内),超过部分为 $18.00;相比之下 Qwen 4 Max 未公布

• 缓存输入 — Gemini 3.1 Pro 缓存读取每 1M 为 $0.20,而 Qwen 4 Max 未公布

• 上下文 — Gemini 3.1 Pro 1,048,576 个 token,而 Qwen 4 Max 未公布

• 输出上限——Gemini 3.1 Pro 为 65,536 个 token,而 Qwen 4 Max 未公布

• 模态 — Gemini 3.1 Pro 支持文本、图像、视频、音频和 PDF 输入,输出文本;而 Qwen 4 Max 未公布

• 推理控制 — Gemini 3.1 Pro 低、中、高思考级别,对比 Qwen 4 Max 未公布

• 长上下文检索 —— Gemini 3.1 Pro 厂商报告的 MRCR v2 在 128K 下对八个针点取平均为 84.9%,但在百万 token 逐点设置下仅为 26.3%,而 Qwen 4 Max 则未报告任何数据

• 厂商报告的分数 — Gemini 3.1 Pro 在 SWE-bench Verified 上为 80.6%,GPQA Diamond 为 94.3%,ARC-AGI-2 为 77.1%,Humanity's Last Exam 在无工具情况下为 44.4%,而 Qwen 4 Max 则未报告任何数据

• 独立评分 — Gemini 3.1 Pro 在 Artificial Analysis Intelligence Index v4.3.2 上为 30,而 Qwen 4 Max 则不存在独立评估

那一行长上下文数据才是真正值得记住的。1,048,576 token 的上下文窗口只是一个营销数字;在百万 token 设置下 26.3% 的检索率,才是同一家厂商在测量该窗口远端时报告的结果。这两个数字都来自 Google,因此这一差距说明的是模型本身,而不是评估者。如果你的工作负载依赖于在百万 token 提示词末尾附近找出某个事实,那么标题里的上下文数字对你毫无用处,而这一行几乎说明了一切。

指数变了,模型没变

Gemini 3.1 Pro 于 2026 年 2 月 19 日发布,在 Artificial Analysis Intelligence Index 上得分为 57,位居该领域第一。在 2026 年 9 月 19 日发布的指数修订版 v4.3.2 下,该得分为 30。在这两个日期之间,模型本身没有任何变化。标尺被重建了,而它是在阿里巴巴 Qwen 4 发布四天前被重建的。

这种巧合比数字本身更有价值。这一批对比中的四个模型里有三个——Gemini 3.1 Pro、Claude Opus 5 和 Qwen 3.8 旗舰版——各自的独立分数都在同一次修订下发生了变动,而且每一次的变动幅度都足以颠覆排名。本月写成的任何对比,若只引用单一指数值而不注明修订版本,就等于是在用不同的尺子量出的分数作比较,而读者根本看不出其中的错误。

对于 Qwen 4 Max 而言,后果就是目标始终在变。当 Alibaba 最终发布时,这个指数上要超越的分数将是当天当前修订版所显示的分数,而该修订版在过去一周内至少变更过一次。

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

运营数据说明了什么,包括那个令人不安的数字

Gemini 3.1 Pro 已可在 OrcaRouter 上路由,模型标识为 google/gemini-3.1-pro-preview,带有“旗舰”与“精选”徽章,且没有预发布横幅,价格采用 Google 的目录价:每百万 token 输入 2.00 美元、输出 12.00 美元,加价幅度为 0%。路由本身是诚实的——页面上的费率就是 Google 公布的价格。截至 9 月 22 日的七天内,运营数据同样值得列出而非略过:首 token 延迟 p50 为 10.00 秒,输出速度约为每秒 632 个 token,而整个窗口期的错误率高达 77.5%。这个错误率绝不是脚注。对于一个没有正式发布(GA)日期的预览级模型而言,它是页面上与决策最相关的单一数字,而只引用价格却不提及它的对比,是在推销,而不是在提供信息。

同一份目录在单个与 OpenAI 兼容的端点上提供近 200 个模型,并具备自动故障转移和路由 DSL,正是这一机制让那样的错误率变得可以承受而非致命:一条降级的提供商路径可以被故障转移,而不是被直接下线。Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-Flash 和 Qwen3.8-27B——与 Gemini 3.1 Pro Preview 位于同一个端点上,因此本文真正要谈论的那种替换,那种你今天就能做出的替换,是一次路由策略的变更,而非一个迁移项目。Qwen 4 Max 不在该目录中,Qwen 4 的任何档位也都不在;等到某一款发布时,它才会出现在那里。

这个决定,姑且算是吧

这里的两个模型都不是你能放心投入生产的产品,而诚实的建议就是据此对待两者。Gemini 3.1 Pro 今天就可以按公布的价格调用,有公布的上下文窗口和公开的评测记录,包括该窗口最远端处的检索弱点;它同时还是一个预览版,其厂商明确告诉你需要为弃用做规划,并且运行时的错误率高到对于生产依赖而言不可接受。Qwen 4 Max 没有这些问题,因为它不具备这些属性。

如果你现在就需要一个模型,那么选择并不在这两者之间,而是在 Gemini 3.1 Pro 与已发布的 Qwen 旗舰模型之间;就现有证据来看,这是一个关于长上下文检索质量,与每百万输入 token 2.00 美元的价格并公开权重之间的取舍。如果你能等,那就别只盯着一件事,而要盯两件事:Qwen 4 Max 的模型卡,以及 Gemini 3.1 Pro 的正式可用日期。哪一个先到来,就说明阿里巴巴和谷歌实际上更优先推进这两条路线图中的哪一条。

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新