为 Claude Sonnet 5.5 与 Gemini 3.1 Pro 生成的主视觉标题卡,副标题为“按 token 更便宜,按任务计则贵十一倍”,显示每百万 token 为 $2.00 和 $10.00,对比 $2.00 和 $12.00,右侧注明 65,536 token 的输出上限,右下角合成了 OrcaRouter 标志。
Guides & Insights

Claude Sonnet 5.5 与 Gemini 3.1 Pro:按 Token 计更便宜,按任务计贵十一倍

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在价目表上,Claude Sonnet 5.5 是更便宜的模型,而在能力上两者的差距却毫不接近。它于 2026 年 9 月 28 日正式可用,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元;Gemini 3.1 Pro 于 2026 年 2 月 19 日发布,至今仍通过预览端点提供服务,价格则是 2.00 美元和 12.00 美元。Sonnet 5.5 在 Artificial Analysis 的 Intelligence Index v4.3 上也拿到 56 分,而 Gemini 3.1 Pro Preview 只有 30 分——在同一个测试框架上相差二十六分。Gemini 的 1,048,576 token 上下文是它唯一一项全面胜出的标志性数字。然而同一位评估者报告称,完成一个开放式任务在 Google 模型上花费 0.67 美元,在 Anthropic 模型上则要 7.60 美元,这是反方向上的十一倍。两个数字都是正确的,而它们之所以能同时成立——一边是 65,536 token 的输出上限,另一边是啰嗦的问题——正是这次比较的全部内容。

每个端点实际上是什么

先厘清身份,再做算术。这里讨论的对象是 anthropic/claude-sonnet-5.5,于 2026 年 9 月 28 日发布,支持文本、图像和文件输入,上下文 1,000,000 token,最大输出 128,000 token,在 Claude Platform 上采用自适应思考,effort 参数默认设为 high。对手是 google/gemini-3.1-pro-preview,于 2026 年 2 月 19 日发布,支持文本、图像、视频、音频和文件输入,上下文 1,048,576 token,最大输出 65,536 token。这两个名字中,有一个带有一个另一个没有的词,而这并非装饰。

这个预览后缀已经存在七个月了。在这段时间里,Google 发布了多个 Flash 版本,却没有推出 Pro 层级的后继者;被 3.1 Pro 取代的模型已被列为关停。这些都不是模型本身的缺陷——它一直在线、稳定,定价也始终正确——但这确实意味着,你正在对接的端点不受正式发布(GA)生命周期承诺的覆盖,而这个系列已经退役过一款 Pro 模型。要把这一点当作一项长期存在的正式条目,而不是脚注,因为一旦判断失误,它会改变一项多年期架构决策的成本。

两个指向相反方向的数字

先说逐 token 比较,因为这是所有人都会跑的那个,而且它更有利于较新的模型。

• 输入 — 两者均为每百万 $2.00;按标价计算完全持平

• 输出 — Claude Sonnet 5.5 为 $10.00,而 Gemini 3.1 Pro 为 $12.00;Anthropic 模型便宜 17%

• 缓存读取 — 层级边界以下两者均为每百万 $0.20

• 缓存写入 — 在 Claude Sonnet 5.5 上,五分钟窗口为每百万 2.50 美元,而 Gemini 3.1 Pro 为 0.375 美元;Google 写入一条缓存条目的成本大约便宜七倍

• 背景 — 1,000,000 与 1,048,576;一个没有实际影响的差异

• 最大输出——128,000 个 token,对比 65,536 个;Anthropic 模型的上限几乎是后者的两倍

• 输入模态 — 文本、图像和文件对比文本、图像、视频、音频和文件

接着是每任务成本对比,来自同一评估方,在同一周内,双方都采用最大努力配置:Claude Sonnet 5.5 为 7.60 美元,而 Gemini 3.1 Pro 为 0.67 美元。相差十一倍。其机制在同一页上有据可查,而非靠推断——Sonnet 5.5 在整个索引套件中生成了 4.1 亿个 token,而该领域的中位数为 8800 万,评估方称其非常啰嗦;而 Gemini 3.1 Pro 则被描述为相当简洁。当一款模型的输出量是另一款的好几倍时,输出速率上 17% 的优势在账单面前根本站不住脚。

这节课的道理超越了这两个模型:价目表给词元标价,而你要为完成的工作付费。任何止步于价目表的比较,衡量的都是错误的量。

位于 200,000 个 token 处的层级边界

Gemini 3.1 Pro 的定价并非统一费率,而且这一阶梯幅度足够大,足以让上文对比中的部分结论发生反转。当提示词低于 200,000 token 时,费率为输入 $2.00、输出 $12.00,缓存读取 $0.20。超过这一门槛后,整个调用会重新计价:输入 $4.00、输出 $18.00、缓存读取 $0.40——输入费率翻倍,正好是 Claude Sonnet 5.5 的两倍;而输出则从 Anthropic 一侧便宜 17%,变为 Google 一侧贵 80%。

这个界限并不稀奇。一个 20 万 token 的提示词,就相当于一个小型代码库、一长套合同、几个小时的转录文本,或一个已经运行了一段时间的智能体。长上下文任务正是 100 万 token 窗口所主打的场景,因此,最能从这个窗口中获益的档位,也正是价格优势消失的档位。如果你的提示词经常超过 20 万 token,请按 $4.00 和 $18.00 来评估 Gemini 3.1 Pro,而不是按落地页上的价格。

缓存写入值得单独用一句话来说,因为它在另一个方向上发生反转,并且能跨越层级变化而保持不变。以每百万 $0.375 对 $2.50 而言,用 Gemini 填充缓存的成本要低得多,而且当你跨过那道边界时,这个费率并不会改变。对于那种每轮都要重建一大段前缀、而不是复用同一段前缀的 agent 来说,这一行所带来的结构性优势,可能比输入费率还要大——而它也是这份对比中唯一一行不受任何层级边界影响的条目。

65,536 个词元的上限,以及它为何决定架构

最能改变你可构建内容的那个数值是最大输出:Gemini 3.1 Pro 为 65,536 个 token,而 Claude Sonnet 5.5 为 128,000 个。上限不是性能指标;它是对任务能否在一次调用中完成的约束。

任何会产出大型产物的东西——一份完整的源文件、一份长报告、一份完整文档、一个结构化数据集——在 Gemini 的情况下只要超过 65,536 个 token,就必须被分解成一条调用链,并在各次调用之间传递状态。分解会在每一步都消耗更多输入 token、带来更多编排代码,还会在一个分块结束、下一个分块开始的接缝处引入一种新的失败模式。第二个约束让问题雪上加霜:Anthropic 自己的材料把 Sonnet 5.5 可靠完成长任务的实际阈值定得明显更高,而 Gemini 的上限是两者中更紧的那个,只有前者的一半。如果你最长的产物是 40,000 个 token,这一节就与你无关,你应该按每任务成本来比较。如果是 100,000,那么上限已经替你做了决定。

模态,Gemini 完全独占的唯一维度

Gemini 3.1 Pro 接受视频和音频;Claude Sonnet 5.5 接受文本、图像和文件,但不能接受视频或音频。对于围绕媒体构建的工作负载——通话录音、屏幕截图、产品视频、会议音频——在这一组合中没有替代方案,而且价格比较已无意义,因为两个端点中只有一个能够接受该输入。对于文本和图像工作负载,能力集有重叠,上述价格计算起决定作用。

Gemini 的另一个运行指标值得说明,因为在以智能为卖点的页面上很容易被忽略:我们的目录测得,在 p50 下首个 token 延迟的中位数为 10,000 毫秒,输出速率接近每秒 1,283 个 token,七天错误率为 56.8%。这是一个速度极快的模型,同时观测到的失败率也非常高——这种组合更适合有充裕重试预算的批处理工作,而远不适合任何用户正在等待的任务。相比之下,Claude Sonnet 5.5 是更慢、更稳定的画像。错误率并未出现在两家厂商的落地页上;这类数字只有在候选模型都位于一个对其进行测量的单一端点之后才会显现,这也是应当从一个地方而非两个仪表盘来评估两者的原因之一。

路由什么到哪里

当任务是文本或图像时,当质量门槛高到 26 个点的指数差距都至关重要时,当输出产物长到需要 128,000 token 上限时,或者当工作负载是交互式且 56.8% 的错误率不可接受时,就把它发给 Claude Sonnet 5.5。在结构化、有界任务上,产生 7.60 美元这一数字的冗长惩罚基本消失,而按 token 的优势就变成了真金白银。

当输入包含视频或音频时,当提示词保持在 200,000 个 token 以下且使用量很高时,当你频繁写入大型缓存并且 $0.375 的缓存写入成本不断叠加时,或者当任务呈批处理形态、每任务成本是唯一重要的那一列时,就把它交给 Gemini 3.1 Pro——每任务 $0.67 对比 $7.60,你完全负担得起大量重试。

目前两者都可以在 OrcaRouter 上进行路由。google/gemini-3.1-pro-preview 和 anthropic/claude-sonnet-5 都是同一凭据下的现役目录条目,按提供商的标价计费,0% 加价,这意味着上面的拆分可以表示为一条路由规则,而不是两个集成——媒体类请求发往一个端点,文本与图像请求发往另一个端点,并在任一端点开始报错时进行故障转移。Claude Sonnet 5.5 还不是我们平台上的路由;等它上线后,同一条规则即可覆盖它,无需新增密钥。

这场对决的诚实结论是:Claude Sonnet 5.5 是明显更好的模型,而且按 token 算还更便宜;而在开放式任务中,Gemini 3.1 Pro 每完成一项任务的成本大约只有它的十一分之一,写缓存的成本只有六分之一,并且是两者中唯一能看视频的那个。任何拿价目表跟你说事的人,描述的都是一种并不存在的比较;真正存在的那种比较,关乎的是你能给哪些请求划定边界。

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新