一个用于“Claude Fable 5.1 vs Gemini 3.1 Pro”的英雄标题卡片,副标题为“九天旗舰 vs 七个月预览”,包含两张圆角卡片——左侧为“Claude Fable 5.1”(2026年9月1日发布,每1M $10.00 / $50.00,AA指数66),右侧为“Gemini 3.1 Pro”(自2026年2月19日起预览,每1M $2.00 / $12.00,多模态)——两者之间有一个VS气泡,右下角为OrcaRouter标志。
Guides & Insights

Claude Fable 5.1 对决 Gemini 3.1 Pro:九日新旗舰对七月预览版

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

问错了关于 Claude Fable 5.1Gemini 3.1 Pro Preview 的问题,你会得到一个无聊的答案:Anthropic 的新旗舰能力更强,Google 的模型更便宜,结论已定。真正决定这场对决的,是一个关于“年龄”的问题。Claude Fable 5.1 于 2026 年 9 月 1 日发布,截至本文撰写时它才问世九天。Gemini 3.1 Pro Preview 于 2026 年 2 月 19 日发布,Google 至今仍将其标注为预览版——这意味着该模型已经近七个月没有任何变化,而一系列更新的 Gemini 版本(3.5、3.6 和 3.7 Flash 系列,以及 9 月 2 日的 Gemini 3.8 Flash)相继发布、获得评分并超越了它。将这两者进行比较,与其说是一次基准测试,不如说是对两种截然不同的发布理念的一次押注,而“新鲜度差距”正是每份规格表都遗漏的东西。

七个月的预览,九天的旗舰

Gemini 3.1 Pro 在二月是 Google 的前沿推理模型——在当时属于“前沿”,它有着强大的软件工程和智能体(agentic)能力宣称,以及至今仍使其独树一帜的原生多模态基础。此后 Google 一直没有将其正式发布(GA)。在它处于预览阶段的七个月里,Anthropic 已发布两代旗舰模型:7 月 24 日的 Claude Opus 5,以及现在的 Claude Fable 5.1——Anthropic 将其定位为 Opus 级别之上的 Mythos 级,并以 66 分登顶 Artificial Analysis 智能指数。当你选择购买 Gemini 3.1 Pro 时,你买到的是一个 Google 实际上早已在产品线其他位置决定其继任方案的模型;而当你选择购买 Claude Fable 5.1 时,你买到的是 Anthropic 目前正在持续改进的模型。

这种不对称性体现在小字细则中。冻结的预览版带有这样的风险:你所选定为标准的能力,可能永远得不到正式版(GA)的打磨、定价调整,或后续的小版本更新。而问世仅九天的旗舰版则面临相反的风险——下个月可能就会发布 5.2 或某个小版本,从而改变目标。这两种风险都无法避免;关键在于它们指向相反的方向,而你能容忍哪一种,才是这个决策中真正需要考量的因素。

并排对照的规格表

• 价格 — Claude Fable 5.1 每1M token 为 $10.00 / $50.00,而 Gemini 3.1 Pro 每1M token 为 $2.00 / $12.00(最多200K输入token),超过200K后为 $4.00 / $18.00。基础层级下,输入成本约便宜5倍,输出成本约便宜4倍。

• 上下文/最大输出 — 两者均支持 1M token 上下文;Claude Fable 5.1 可输出高达 128K,而 Gemini 3.1 Pro 的上限约为 65K。

• 输入 — Claude Fable 5.1 支持文本和图像。Gemini 3.1 Pro 支持文本、图像、音频、视频和 PDF,并原生集成 Google 搜索接地。

• 独立评分——Claude Fable 5.1 在 Artificial Analysis Intelligence Index(最大努力)上得分为66,而 Gemini 3.1 Pro 则处于40多分(其发布时为57分,随着AA重新运行评估而有所下滑)。

• 速度——根据 OrcaRouter 自身的遥测数据,Gemini 3.1 Pro 的流式输出速度约为每秒 540 个 token,而 Artificial Analysis 测得 Claude Fable 5.1 的速度为每秒 67.2 个 token——这是另一方向上的巨大吞吐量差距。

• 状态 — Claude Fable 5.1 稳定版,GA,发布于 2026-09-01;Gemini 3.1 Pro 预览版,发布于 2026-02-19,截至 2026 年 9 月中旬尚未 GA。

A two-column scoreboard titled 'Claude Fable 5.1 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Claude Fable 5.1': 'Price $10.00 / $50.00 per 1M', 'Released Sep 1, 2026 (GA)', 'AA Intelligence Index 66 (max)', 'Max output 128K', 'Inputs text + image', 'Cache read $0.25'. Right column 'Gemini 3.1 Pro': 'Price $2.00 / $12.00 per 1M (≤200K)', 'Released Feb 19, 2026 (Preview)', 'AA Intelligence Index upper 40s', 'Max output ~65K', 'Inputs text, image, audio, video, PDF', 'Cache read $0.20'. Footer: 'AA per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'

基准图片,如实标注

就原始能力而言,这两款模型并不在同一档次,独立指数比任何厂商的宣传幻灯片都更能说明这一点。Claude Fable 5.1 在 Artificial Analysis Intelligence Index(最大努力模式)上的 66 分是 AA 有记录以来的最高分——尽管 AA 针对 Anthropic 提供的默认回退配置所展示的模型页面上列为 53 分,在 201 个模型中仍排名第一——而 Gemini 3.1 Pro 则停留在 40 多分。在 Anthropic 报告的组件基准测试中,Fable 5.1 在 Terminal-Bench 4.0 上取得 55.8%,在 Terminal-Bench-Science 0.1 上取得 52.6%——这些分数尚未有人在任何独立测试中归因于 Gemini 3.1 Pro。而在被广泛验证的 SWE-bench 风格榜单上,Gemini 3.1 Pro 二月份时代的成绩(根据第三方追踪机构数据,SWE-bench Verified 约为 75%)远远落后于当前一代 Claude。

然而,在一切多模态任务上,诚实的告诫却指向相反方向。Gemini 3.1 Pro 能读取原生音频、原生视频和 PDF,并且内置 Google 搜索——这些是 Claude Fable 5.1 完全没有提供的能力,因为 Anthropic 的旗舰模型只接受文本和图像。在处理长文档、长视频或依赖搜索的工作时,Gemini 3.1 Pro 不仅更便宜;它还是两者中唯一能通过单次调用完成任务的那个。这是一个实实在在的优势,而当你看到的每个基准测试都是文本和代码时,这个优势很容易被低估。

Screenshot of the Artificial Analysis model page for Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), captured September 10, 2026, showing a #1-of-201 ranking, an Intelligence Index of 53 for the default-fallback configuration, pricing of $10.00 per 1M input and $50.00 per 1M output with a 98% cache discount, a cost of $7.63 per Intelligence Index task, and 190M output tokens against a 92M median.

价格悬崖掩盖了真实的成本故事

Gemini 3.1 Pro 的标价 $2 / $12 仅适用于每次请求输入低于 20 万 token 的情况。超过这一阈值后,整个请求会按输入 $4.00、输出 $18.00 重新计价——输入价格翻倍,这让长上下文 Gemini 调用的实际成本远不如营销数字所暗示的那么便宜。Claude Fable 5.1 的 $10 / $50 在任何长度下都是统一的,缓存读取价格为 $0.25,而随着会话反复重读上下文,这一价格相对于其自身标价会越来越便宜。交叉点取决于工作负载形态:短促且高并发的多模态调用让 Gemini 3.1 Pro 遥遥领先;而长时间运行、反复重读大上下文的代理会话,则更青睐 Claude Fable 5.1 的缓存经济性——即使不考虑能力差异也是如此。

谁应该选择哪个

当工作负载确实是多模态或基于搜索时,当低价格下的吞吐量比推理能力上限更重要时,以及当你愿意将 Google 已留在预览版七个月、且最好带有通向 Google 下一个正式发布(GA)模型迁移路径的模型作为标准时,选择 Gemini 3.1 Pro。当你需要当前推理能力的上限时,当你在构建长时程智能体且 128K 输出上限和 0.25 美元缓存读取至关重要时,以及当你更愿意押注于一个其供应商正在积极改进的模型时,选择 Claude Fable 5.1。两者在 OrcaRouter 上均按各自提供商的列表价格提供,零加价,因此这一决策的路由 DSL 版本日后修改起来成本很低:将多模态和大流量请求发送到 Gemini 3.1 Pro,将困难推理和智能体流量升级到 Claude Fable 5.1,并在 Google 最终正式发布(GA)其 Pro 层的那一天——或 Anthropic 推出 Fable 5.1 后续产品的那一天——重新调整分流比例。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing $2.00 per 1M input and $12.00 per 1M output, the 1M-token context window with 65K max output, and Vision/Audio/Tools/JSON/Reasoning capability chips.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube