
Claude Fable 5.1 对决 Gemini 3.1 Pro:九日新旗舰对七月预览版
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49代码
问错了关于 Claude Fable 5.1 和 Gemini 3.1 Pro Preview 的问题,你会得到一个无聊的答案:Anthropic 的新旗舰能力更强,Google 的模型更便宜,结论已定。真正决定这场对决的,是一个关于“年龄”的问题。Claude Fable 5.1 于 2026 年 9 月 1 日发布,截至本文撰写时它才问世九天。Gemini 3.1 Pro Preview 于 2026 年 2 月 19 日发布,Google 至今仍将其标注为预览版——这意味着该模型已经近七个月没有任何变化,而一系列更新的 Gemini 版本(3.5、3.6 和 3.7 Flash 系列,以及 9 月 2 日的 Gemini 3.8 Flash)相继发布、获得评分并超越了它。将这两者进行比较,与其说是一次基准测试,不如说是对两种截然不同的发布理念的一次押注,而“新鲜度差距”正是每份规格表都遗漏的东西。
七个月的预览,九天的旗舰
Gemini 3.1 Pro 在二月是 Google 的前沿推理模型——在当时属于“前沿”,它有着强大的软件工程和智能体(agentic)能力宣称,以及至今仍使其独树一帜的原生多模态基础。此后 Google 一直没有将其正式发布(GA)。在它处于预览阶段的七个月里,Anthropic 已发布两代旗舰模型:7 月 24 日的 Claude Opus 5,以及现在的 Claude Fable 5.1——Anthropic 将其定位为 Opus 级别之上的 Mythos 级,并以 66 分登顶 Artificial Analysis 智能指数。当你选择购买 Gemini 3.1 Pro 时,你买到的是一个 Google 实际上早已在产品线其他位置决定其继任方案的模型;而当你选择购买 Claude Fable 5.1 时,你买到的是 Anthropic 目前正在持续改进的模型。
这种不对称性体现在小字细则中。冻结的预览版带有这样的风险:你所选定为标准的能力,可能永远得不到正式版(GA)的打磨、定价调整,或后续的小版本更新。而问世仅九天的旗舰版则面临相反的风险——下个月可能就会发布 5.2 或某个小版本,从而改变目标。这两种风险都无法避免;关键在于它们指向相反的方向,而你能容忍哪一种,才是这个决策中真正需要考量的因素。
并排对照的规格表
• 价格 — Claude Fable 5.1 每1M token 为 $10.00 / $50.00,而 Gemini 3.1 Pro 每1M token 为 $2.00 / $12.00(最多200K输入token),超过200K后为 $4.00 / $18.00。基础层级下,输入成本约便宜5倍,输出成本约便宜4倍。
• 上下文/最大输出 — 两者均支持 1M token 上下文;Claude Fable 5.1 可输出高达 128K,而 Gemini 3.1 Pro 的上限约为 65K。
• 输入 — Claude Fable 5.1 支持文本和图像。Gemini 3.1 Pro 支持文本、图像、音频、视频和 PDF,并原生集成 Google 搜索接地。
• 独立评分——Claude Fable 5.1 在 Artificial Analysis Intelligence Index(最大努力)上得分为66,而 Gemini 3.1 Pro 则处于40多分(其发布时为57分,随着AA重新运行评估而有所下滑)。
• 速度——根据 OrcaRouter 自身的遥测数据,Gemini 3.1 Pro 的流式输出速度约为每秒 540 个 token,而 Artificial Analysis 测得 Claude Fable 5.1 的速度为每秒 67.2 个 token——这是另一方向上的巨大吞吐量差距。
• 状态 — Claude Fable 5.1 稳定版,GA,发布于 2026-09-01;Gemini 3.1 Pro 预览版,发布于 2026-02-19,截至 2026 年 9 月中旬尚未 GA。

基准图片,如实标注
就原始能力而言,这两款模型并不在同一档次,独立指数比任何厂商的宣传幻灯片都更能说明这一点。Claude Fable 5.1 在 Artificial Analysis Intelligence Index(最大努力模式)上的 66 分是 AA 有记录以来的最高分——尽管 AA 针对 Anthropic 提供的默认回退配置所展示的模型页面上列为 53 分,在 201 个模型中仍排名第一——而 Gemini 3.1 Pro 则停留在 40 多分。在 Anthropic 报告的组件基准测试中,Fable 5.1 在 Terminal-Bench 4.0 上取得 55.8%,在 Terminal-Bench-Science 0.1 上取得 52.6%——这些分数尚未有人在任何独立测试中归因于 Gemini 3.1 Pro。而在被广泛验证的 SWE-bench 风格榜单上,Gemini 3.1 Pro 二月份时代的成绩(根据第三方追踪机构数据,SWE-bench Verified 约为 75%)远远落后于当前一代 Claude。
然而,在一切多模态任务上,诚实的告诫却指向相反方向。Gemini 3.1 Pro 能读取原生音频、原生视频和 PDF,并且内置 Google 搜索——这些是 Claude Fable 5.1 完全没有提供的能力,因为 Anthropic 的旗舰模型只接受文本和图像。在处理长文档、长视频或依赖搜索的工作时,Gemini 3.1 Pro 不仅更便宜;它还是两者中唯一能通过单次调用完成任务的那个。这是一个实实在在的优势,而当你看到的每个基准测试都是文本和代码时,这个优势很容易被低估。

价格悬崖掩盖了真实的成本故事
Gemini 3.1 Pro 的标价 $2 / $12 仅适用于每次请求输入低于 20 万 token 的情况。超过这一阈值后,整个请求会按输入 $4.00、输出 $18.00 重新计价——输入价格翻倍,这让长上下文 Gemini 调用的实际成本远不如营销数字所暗示的那么便宜。Claude Fable 5.1 的 $10 / $50 在任何长度下都是统一的,缓存读取价格为 $0.25,而随着会话反复重读上下文,这一价格相对于其自身标价会越来越便宜。交叉点取决于工作负载形态:短促且高并发的多模态调用让 Gemini 3.1 Pro 遥遥领先;而长时间运行、反复重读大上下文的代理会话,则更青睐 Claude Fable 5.1 的缓存经济性——即使不考虑能力差异也是如此。
谁应该选择哪个
当工作负载确实是多模态或基于搜索时,当低价格下的吞吐量比推理能力上限更重要时,以及当你愿意将 Google 已留在预览版七个月、且最好带有通向 Google 下一个正式发布(GA)模型迁移路径的模型作为标准时,选择 Gemini 3.1 Pro。当你需要当前推理能力的上限时,当你在构建长时程智能体且 128K 输出上限和 0.25 美元缓存读取至关重要时,以及当你更愿意押注于一个其供应商正在积极改进的模型时,选择 Claude Fable 5.1。两者在 OrcaRouter 上均按各自提供商的列表价格提供,零加价,因此这一决策的路由 DSL 版本日后修改起来成本很低:将多模态和大流量请求发送到 Gemini 3.1 Pro,将困难推理和智能体流量升级到 Claude Fable 5.1,并在 Google 最终正式发布(GA)其 Pro 层的那一天——或 Anthropic 推出 Fable 5.1 后续产品的那一天——重新调整分流比例。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
