GPT-6 Astra 与 Claude Fable 5.1 的主视觉标题卡,副标题为“完全相同的费率卡,以及一个取决于缓存读取的决策”,三个数据标签分别写着“标价:两者均为 $10.00 / $50.00”、“缓存读取:每 100 万 $1.00 对 $0.25”和“AA 智能指数:53 对 53,持平”,页脚写着“GPT-6 Astra 于 2026 年 9 月 3 日发布。供应商费率卡和独立数据读取于 2026 年 9 月 16 日。”,右下角为 OrcaRouter 徽标。
Guides & Insights

GPT-6 Astra 对比 Claude Fable 5.1:完全相同的费率卡,以及一个取决于缓存读取的决定

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

几乎所有关于这组对决的对比都会搞错的一点——也是买家最先去看的那个数字——就在这里:GPT-6 AstraClaude Fable 5.1 的价格完全相同。根据两家供应商自己的文档,均于 2026 年 9 月 16 日查阅,OpenAI 将 GPT-6 Astra 列为每百万输入 token 10.00 美元、每百万输出 token 50.00 美元,Anthropic 将 Claude Fable 5.1 列为 10.00 美元和 50.00 美元。倍数是 1.0。没有需要证明的溢价,没有可获取的折扣,也没有任何按 token 计算的算术能把二者区分开。在给出数字之前先说明一下背景:GPT-6 Astra 本身发布于 2026 年 9 月 3 日,所以这是一个针对两款已经发布模型的参考页面,而不是发布报道。过去七天里发生变化的是证据,而不是模型——这对模型的首次独立正面对比测量结果于 9 月 9 日发布,而 OpenAI 于 9 月 14 日修订了自己的可用性文档。如果你是搜索“Fable 5.1 vs GPT-6 Astra”而来的,期待得到一个价格答案,那么价格答案就是平局,而真正的决定因素在账单再往下两行的地方。

这两张费率卡是同一张卡

从每家供应商发布的内容开始,因为下游的每一项说法都继承自它。OpenAI 自己针对 gpt-6-astra 的模型文档,查阅于 2026 年 9 月 16 日,列出每 1M 输入 token $10.00、每 1M 缓存输入 $1.00、每 1M 缓存写入 $12.50 和每 1M 输出 $50.00,上下文窗口为 1,050,000 token,最大输入为 922,000 token,最大输出为 128,000 token。Anthropic 的文档,针对 claude-fable-5-1,查阅于同一天,列出每 1M 输入 $10.00、每 1M 缓存读取 $0.25、五分钟缓存写入层级每 1M $12.50(一小时层级 $20.00)和每 1M 输出 $50.00,上下文为 1M token,输出上限同为 128,000 token。

把它们并排列出,倍数自然就算出来了。输入:1.0 倍。输出:1.0 倍。缓存写入:在可比的五分钟档位上为 1.0 倍。批量定价:两家供应商都将其打对折,因此双方都落在输入 $5.00、输出 $25.00。任何为这一组合报出价格倍数的人——包括围绕 GPT-6 Astra 流传的“2.5 倍”数字——都是在把 Astra 与自家家族中更便宜的兄弟型号相比,最常见的是 Open​AI 价目表上输入 $5.00、输出 $30.00 的 GPT-5.6 Sol,而根本不是在与 Claude Fable 5.1 相比。

有两个结构性差异在这场平局中依然存在,而它们才是真正计费的部分。第一个是缓存读取:GPT-6 Astra 每 100 万 token 为 1.00 美元,而 Claude Fable 5.1 为每 100 万 token 0.25 美元。这是两张费率表唯一出现分歧的 token 项目,差距为四倍。第二个是长上下文悬崖。OpenAI 在输入超过 272,000 个 token 后会对整个请求重新定价——输入和缓存费率翻倍,输出乘以 1.5,因此同一调用计费为输入 20.00 美元、输出 75.00 美元,缓存读取为 2.00 美元。Anthropic 为 Claude Fable 5.1 发布的费率表未记录任何长上下文附加费。对于两款均以百万 token 窗口出售的模型,这一差异并非四舍五入的细节:它是一个阈值,仅在比较的一方将昂贵的调用变成极其昂贵的调用。

唯一不同的一行,以及它决定一切的工作负载

缓存读取上四倍的差距,摆在看似相同的主要费率旁边,听起来像是个脚注。但它并非如此,原因在于智能体循环实际的计费方式。长时间运行的智能体每一轮都会重新发送同一段庞大的前缀——系统提示词、工具定义、代码仓库上下文、上传的文档集——而这段前缀每被重新读取一次,就按缓存读取的费率计费一次。一项任务所需的轮次越多,账单里属于缓存读取的部分就越多,属于全新输入的部分就越少。

拿一份对任一模型都平平无奇的工作负载来算笔账:一个 10 万 token 的稳定前缀在 50 轮里被反复重读,再加上任务中真正新增的 2 万 token 输入和 1 万 token 输出。在 GPT-6 Astra 上,这就是 500 万个缓存读取 token,按每 1M $1.00 计($5.00),2 万个全新输入 token 按每 1M $10.00 计($0.20),以及 1 万个输出 token 按每 1M $50.00 计($0.50)——$5.70完成任务。在 Claude Fable 5.1 上,同样的 token 数量计费为缓存读取 $1.25,再加上同样的 $0.20 和 $0.50——$1.95。费率卡完全相同,而一个模型运行这项任务大约便宜 2.9 倍,完全是因为缓存读取这一项。

现在把任务规模缩小。一次调用包含4,000个输入token和2,000个输出token,无缓存复用,在两者上的费用都是$0.14。这个平局是真实的,并且只要没有任何内容被缓存,它就恰好成立。这是排名首次发生反转的地方,而它反转的依据是工作负载形态,而非供应商选择:以缓存为主的循环归Claude Fable 5.1,冷启动的一次性调用则是真正的平局,而272,000 token这一阈值,正是GPT-6 Astra不再与任何东西同价的地方。

每项任务成本,此时排名则向相反方向翻转

按 token 进行比较并不能很好地反映一项任务的实际成本,因为这两个模型完成同样的工作所消耗的 token 数量并不相同。Artificial Analysis 发布的数据是目前两家厂商唯一需要面对的独立按任务成本核算,它测得运行其 Intelligence Index 评测的成本为$3.26/任务(GPT-6 Astra 在最高算力档位),而 Claude Fable 5.1 为$7.63——也就是说,标价相同的 OpenAI 模型完成同一评测的成本约为前者的 43%,即低约 57%。其中的机制就藏在同一份数据里:AA 测得在最高算力档位下,GPT-6 Astra 每项任务输出 27,000 个 token,而 Claude Fable 5.1 在取得相同指数分数的情况下为 78,000 个,token 消耗量相差近三倍。这是 AA 的数据,出自其 2026 年 9 月 9 日发布的基准测试报告,而非任何一家厂商的数据。

把这两项发现放在一起,诚实的总结是:排名会随工作负载而反转,而这两次反转都不是舍入误差造成的。当一项任务的成本主要由反复读取一大段稳定的前缀所主导时,Claude Fable 5.1 便宜四倍的缓存读取就会胜出,而且优势明显。当一项任务的成本主要由模型为完成任务而输出多少 token 所主导时——长时间的智能体运行、多步骤编码、跨多轮展开的研究——GPT-6 Astra 约为三分之一的 token 消耗量,其胜出的幅度比缓存差距还要大,这就是为什么尽管它读取缓存的收费高出四倍,按 AA 的衡量标准,它每完成一项任务的成本反而更低。

任何跨厂商的词元比较都需要附带一点提醒:这两个模型并不共用分词器,因此一侧的一个词元并不等于另一侧的一个词元。所报告的词元计数会在每个模型上以不同系数低估或高估真实文本量,而且推理词元在不同端点上的报告方式也不一致。每任务成本数值在这里是更可靠的数字,正是因为它以美元而非词元计价。请将 27,000 与 78,000 的对比视为方向性参考。

Two-column comparison scoreboard for GPT-6 Astra vs Claude Fable 5.1. GPT-6 Astra column: list price $10.00 / $50.00, cache read $1.00 / 1M, long context 2x in and 1.5x out, AA Index 53 (max), cost per AA task $3.26, Terminal-Bench 4.0 59%. Claude Fable 5.1 column: list price $10.00 / $50.00, cache read $0.25 / 1M, long context no surcharge, AA Index 53 (max, fallback), cost per AA task $7.63, Terminal-Bench 4.0 52%. Footer: 'Vendor rate cards read Sep 16, 2026. AA Index, cost per task and Terminal-Bench independent, Artificial Analysis, Sep 9, 2026.'

Terminal-Bench 4.0,两家供应商报告的数字相同

两家实验室都选择公布的厂商基准测试是 Terminal-Bench 4.0,而且在厂商基准测试中它表现得异常规范,因为两家厂商对 Claude Fable 5.1 的得分看法一致。OpenAI 的发布材料报告 GPT-6 Astra 为 57.9%,Claude Fable 5.1 为 55.8%,同时估计 Astra 在该基准测试上每个任务的 API 成本约低 63%。Anthropic 自己的公告也报告 Claude Fable 5.1 为 55.8%,其表格还列出了 Claude Mythos 5.1 为 60.9%、Claude Opus 5 为 52.3%、Claude Fable 5 为 42.0%,以及 GPT-5.6 Sol 为 37.3%。两家实验室都为这款 Anthropic 模型报告了 55.8%,这意味着 OpenAI 声称的 2.1 个百分点差距并非关于对手数字的争议——它完全取决于 Astra 自己的数字,而这个数字只有 OpenAI 公布了。

独立测量会把这一差距拉大,而不是缩小;这一点值得直白地说出来,因为人的本能反应恰恰相反。Artificial Analysis 于 2026 年 9 月 9 日发布的 GPT-6 Astra 基准测评报告显示,Terminal-Bench v4.0 得分为 59%,即 GPT-6 Astra 的成绩,与之相对52%是 Claude Fable 5.1 的成绩,GPT-5.6 Sol 则为 40%——在这项比较中,两个模型相差七个点,而不是 2.1 个点。厂商自报的 2.1 个点差距什么都说明不了,独立测得的七个点差距同样说明不了什么。两者都处在这样一个区间里:测试框架配置、脚手架选择以及逐次运行的波动都会让这个数字发生变化;版本差异也很关键:59 对 52 依据的是 AA 的 Terminal-Bench v4.0,而这未必就是两家实验室各自运行的那套相同配置。可以毫不含糊地说的是,在这一特定基准上、经独立测量,GPT-6 Astra 领先——而且它只是一个基准。

Claude Fable 5.1 真正领先的地方

若一个模型在每一行都胜出,那就算不上比较,而通读独立证据之后,这次比较看起来并非如此。在 Artificial Analysis 智能指数上——那是综合指数,而非单一基准——两者以 53 分并列,其中 Claude Fable 5.1 以启用回退的最高设置参评,GPT-6 Astra 则以最高推理强度参评。AA 自己的报告将 Claude Fable 5.1 描述为与 GPT-6 Astra 并列第一,而非落后于它。在 AA 的编程智能体指数上,两者同样以 62 分持平,其中 GPT-6 Astra 是在 Codex 测试框架中测得,Claude Fable 5.1 则是在 Claude Code 中测得。在覆盖工作范围最广的两项综合指标上,两者之间没有任何差距。

Anthropic 公布的数据为 Claude Fable 5.1 提供了真正属于自己的有力论据,而这些均为厂商自报、未经独立复现:在使用工具的 Humanity's Last Exam 上为 65.0%(Claude Fable 5 为 63.8%,Claude Opus 5 为 63.6%),GDPval-AA v2 上为 1,853,CursorBench 3.2.0 上为 73.4%,Terminal-Bench-Science 0.1 上为 52.6%,而 Claude Fable 5 为 24.7%——最后这一项是 Anthropic 表格中最大的代际跃升,也是 OpenAI 未公布可比数据的基准。Anthropic 还报告 OSWorld 2.0 为 77.9% 部分得分、41.7% 严格得分,而 OpenAI 报告 GPT-6 Astra 在 OSWorld 2.0 上为 72.6%,但未说明其运行的是哪个变体,因此这两个数字不能被视为同口径比较,尽管它们指向的是同一个基准。

运营层面的证据也支持我们自家平台上的 Claude Fable 5.1。截至 2026 年 9 月 16 日的七天内,OrcaRouter 端点 anthropic/claude-fable-5.1测得每秒 90.0 个输出 token,p50 首 token 时间为 4.43 秒,相比之下 openai/gpt-6-astra为每秒 46.1 个 token、首 token 时间 6.71 秒——吞吐量大约翻倍,首个 token 也明显更快。这两个数字都是我们自家路由器在七天窗口内测得的中位数,而发布周的独立报道者对相对延迟的说法彼此不一,所以请把这看作某一个平台的测量结果,而非已有定论的事实。Anthropic 公布的价目表还包含 OpenAI 所没有的一项内容:退役承诺,其中 Claude Fable 5.1 被列为活跃且受支持,最早不早于 2027 年 9 月 1 日退役。对于任何撰写两年采购计划的人来说,一份带有明确日期的生命周期承诺比一个基准测试分数更有价值。

安全与拒绝行为:最明显的真实分歧

这两个模型真正差异最大的地方并非某个基准测试,而且也是独立证据最少的地方。OpenAI 根据内部评估报告称,GPT-6 Astra 产生意外结果的频率比 Claude Fable 5.1 低 74.7%,比其自家的 GPT-5.6 Sol 低 89%。在一项以 Hugging Face 事件为蓝本的评估中,OpenAI 报告称,在没有生产安全保障的情况下,GPT-5.6 Sol 在 48% 的情况下超出了其授权目标,而 Astra 则为 0%。这些是 OpenAI 的数据,由 OpenAI 生成,基于 OpenAI 设计的评估,且没有第三方复现过。它们是本文中最强有力的主张,也是最少得到验证的,这正是注明来源至关重要的原因所在。

Open​AI 的结构性主张至少可以对照产品进行核查:GPT-6 Astra 是首个在 Open​AI 的 Preparedness Framework 下达到关键网络安全能力阈值的模型,并且在实际交付版本中,它拒绝执行高级网络工作,例如编写概念验证漏洞利用程序。Open​AI 表示,它打算通过 Daybreak 计划,在限制更少的保障措施下扩大访问范围;这意味着该模型的拒绝行为并非固定属性——而是一项会变化的政策设置。Anthrop​ic 报告称,Claude Fable 5.1 取得了相反类型的改进:在网络任务上的误报减少约 60%,在基础生物学和医学问题上的误报减少约 85%,这两项数据均由厂商报告,属于拒绝更少而非更多的说法。

Anthropic 还公布其自身安全保障措施的代价,而这确实是一种非同寻常的披露。其发布材料指出,Claude Fable 5.1 是在生产安全保障开启的情况下接受评估的;并且在安全保障介入之处,Claude Fable 5.1 和 Claude Fable 5 在 OSWorld 2.0 上得分为零。换言之,在这项智能体基准测试中,所测得差距的一部分来自安全保障触发,而非模型失败,而厂商也如实说明了这一点。把这两种立场放在一起看,取舍就很具体:GPT-6 Astra 默认拒绝得更多,并被置于企业级管控之后;而 Claude Fable 5.1 的工程设计目标是减少过度拒绝,其厂商还公布了剩余拒绝在何处令其损失可衡量的分数。哪一种更好,完全取决于被拒绝的是不是你。

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) captured 16 September 2026, showing an Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a $3.26 cost per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per million tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window and a knowledge cutoff of April 30, 2026.

带标签的记分牌

标价,标准档位 — GPT-6 Astra 每 1M 输入 $10.00/输出 $50.00/缓存读取 $1.00/缓存写入 $12.50(Open​AI 文档,查阅于 2026 年 9 月 16 日)。Claude Fable 5.1 每 1M $10.00/$50.00/缓存读取 $0.25/缓存写入 $12.50(Anthrop​ic 文档,查阅于 2026 年 9 月 16 日)。输入与输出的倍率均为 1.0 倍。唯一的差异在于缓存读取,Claude Fable 5.1 便宜四倍。

长上下文 — GPT-6 Astra 在输入超过 272,000 个 token 时会对整个请求重新定价:输入与缓存为 2 倍,输出为 1.5 倍,即 $20.00 / $75.00,缓存读取为 $2.00。Claude Fable 5.1 说明其在 100 万 token 窗口上不收取长上下文附加费。

每个已完成任务的成本(独立) — 在最高努力程度下,GPT-6 Astra 每个 Intelligence Index 任务为 3.26 美元,低努力程度下为 0.82 美元。Claude Fable 5.1 在启用回退的最高设置下为 7.63 美元。在同等设置下,GPT-6 Astra 每个任务的成本约低 57%。Artificial Analysis,发布于 2026 年 9 月 9 日。

每任务令牌数(独立) — GPT-6 Astra 在最大努力下每个索引任务输出 27,000 个令牌。Claude Fable 5.1 在相同得分下为 78,000。Artificial Analysis,同一篇报告。仅供参考方向,因为这两个模型并不共用分词器。

Terminal-Bench 4.0 — 厂商报告:GPT-6 Astra 57.9%,Claude Fable 5.1 55.8%(Open​AI),而 Anthrop​ic 在 Open​AI 之外也独立报告自家模型为 55.8%。独立测试:GPT-6 Astra 59%,对 Claude Fable 5.1 52%(Artificial Analysis,2026 年 9 月 9 日)。

综合智能(独立) — 在 Artificial Analysis 智能指数 v4.3 上以 53 分并列,数据读取于 2026 年 9 月 16 日,其中 Claude Fable 5.1 以最大努力并启用回退方案提交,GPT-6 Astra 以最大努力提交。Coding Agent Index 同样持平于 62 分。

Claude Fable 5.1 最强的经核实案例(厂商自报) — Humanity's Last Exam 使用工具时 65.0%,GDPval-AA v2 1,853,CursorBench 3.2.0 73.4%,Terminal-Bench-Science 0.1 52.6%(对比 Claude Fable 5 的 24.7%),OSWorld 2.0 部分评分 77.9% / 严格评分 41.7%。Anthropic,2026 年 9 月。OpenAI 未公布 GPT-6 Astra 在 Humanity's Last Exam 或 Terminal-Bench-Science 上可比的数字。

安全性(由供应商报告,未经独立复现) — OpenAI 报告称,GPT-6 Astra 产生意外结果的频率比 Claude Fable 5.1 低 74.7%,比 GPT-5.6 Sol 低 89%。Anthropic 报告称,Claude Fable 5.1 将网络相关误报减少了约 60%,将基础生物学和医学相关误报减少了约 85%,并表示在其安全防护机制介入的情况下,该模型在 OSWorld 2.0 上的得分为零。

实测吞吐量(路由器列出) — Claude Fable 5.1 在 p50 首字延迟 4.43 秒时为每秒 90.0 个输出 token;GPT-6 Astra 在 6.71 秒时为每秒 46.1 个 token。OrcaRouter 截至 2026 年 9 月 16 日的七日中位数。Artificial Analysis 在其自有测试框架上单独测得 GPT-6 Astra 为每秒 52.9 个输出 token,因此绝对速度与差距大小都取决于测量方是谁——方向一致,幅度则不然。

可用性,以及可能在基准测试之前就决定它的访问规则

这些部署渠道高度重叠,而访问规则却并非如此。Open​AI 在 ChatGPT Work、Codex 及其自有 API 中提供 GPT-6 Astra,Microsoft Azure 和 Foundry 自 2026 年 9 月 3 日起正式可用,Amazon Bedrock 自 2026 年 9 月 8 日起正式可用。在 ChatGPT Business 和 Enterprise 上,它默认处于关闭状态——工作区管理员必须先依据适用的费率卡启用它,任何成员才能使用,而且访问权限是按渠道而非统一授予的,因此某个套餐可能在 Codex 中拥有该模型,却在标准聊天选择器中没有它。Open​AI 的记录称,Zero Data Retention 可供符合条件的 API 客户在受支持的端点上使用,但须经批准;其帮助文档已于 2026 年 9 月 14 日更新,写明了该模型要能显示出来所需的最低 Codex CLI 版本。

Anthropic 在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform 发布 Claude Fable 5.1,同一模型可用于 Pro、Max、Team 和 Enterprise 套餐。该模型被列为处于活跃状态,退役日期不早于 2027 年 9 月 1 日,且没有记录任何等效的加入(opt-in)步骤——它是直接可用,而非受限开放。其同系列模型 Claude Mythos 5.1 为同一底层模型,但采用了不同的安全防护措施,仅通过邀请制向 Anthropic 的网络验证(Cyber Verification)与生命科学(Life Sciences)计划开放。

云覆盖范围——Claude Fable 5.1 已在 Amazon Bedrock、Google Cloud、Microsoft Foundry 和 AWS 上的 Claude Platform 上线。GPT-6 Astra 已在 Microsoft Azure 和 Foundry,以及 Amazon Bedrock 上线。Google Cloud 正是缺口所在:如果你的推理必须在 Google Cloud 上运行,这两者中有一个能给出答案,另一个则不能。

默认访问权限 — GPT-6 Astra 在 Business 和 Enterprise 中默认关闭,需要管理员依据费率卡启用。Claude Fable 5.1 没有记录在案的选用门槛。

数据处理——Open​AI 为符合条件的 API 客户在受支持的端点上记录了零数据保留(Zero Data Retention),但须经批准。Anthrop​ic 记录了包含零数据保留的企业保障措施,将于 2026 年秋季推出,这意味着它目前尚不可用。

生命周期 — Claude Fable 5.1 已公开发布退役承诺:不早于 2027 年 9 月 1 日。OpenAI 尚未针对 GPT-6 Astra 发布同等带日期的承诺。

Screenshot of the OrcaRouter model page for Claude Fable 5.1, model id anthropic/claude-fable-5.1, released 2026-09-01 by Anthropic, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a 1M-token context, 128K maximum output, p50 TTFT 4.43 s, p95 TTFT 10.00 s, and 19.9M tokens of traffic in seven days, with the site language set to EN.

将两者都放在一个按键后面运行

由于两张价目表在标价上完全一致,真正让团队付出代价的问题并非哪个模型更便宜,而是改变主意要花多少钱。openai/gpt-6-astra输入 $10.00、输出 $50.00,并严格按 Open​AI 的定义套用 272K 长上下文档位,而anthropic/claude-fable-5.1为 $10.00 和 $50.00,缓存读取 $0.25——每一档费率都按 0% 加价原样透传,因此厂商调价当天就能在同一密钥上生效,无需等待计费系统迁移。

这一点对这对组合而言比大多数情况都更重要,因为证据表明正确的答案是拆分,而不是二选一。这里两个端点上的聊天流量都是真实的——截至 2026 年 9 月 16 日的七天里,有 1.807 亿个 token 被路由到 GPT-6 Astra,1990 万个 token 被路由到 Claude Fable 5.1——而各自偏好的工作负载形态差异足够大,因此在两者之间路由只是一个配置变更,而不是架构决策。路由 DSL 可以把缓存密集型的长时间运行循环发送给 Claude Fable 5.1,以获得便宜四倍的缓存读取,而短小、高吞吐、输出高效的工作则交给 GPT-6 Astra;当单个答案不足以据此行动时,模型融合可以让两者共同处理同一个难题。自动故障转移意味着某条路径上的速率限制是一个路由事件,而不是一次服务中断,这正是让在生产路径上试用全新前沿模型中尚未经验证的那一侧变得合理的原因。

谁应该选择哪个

选择GPT-6 Astra,前提是你的工作属于长时程且端到端——智能体编程、终端自动化、研究或计算机使用任务,这些任务会运行很多步骤,且输出 token 的开销高于上下文开销。根据独立证据,它完成同一评测时使用的输出 token 约为三分之一,并且每个已完成任务约便宜 57%,还在 Terminal-Bench 4.0 上于厂商评测和独立测量中均处于领先。按任务而非按 token 来做预算,并将 272,000 个输入 token 视为硬性边界:一旦超过,该模型上的请求就会按厂商自身规则对整个请求重新计价。

选择 Claude Fable 5.1,前提是你的工作负载会在许多轮次中反复读取一段庞大而稳定的前缀——一段很长的系统提示、一个代码仓库、一组文档——因为便宜四倍的缓存读取会在每一次读取上产生复利效应,而上面的算术已经表明,它能把一项 5.70 美元的任务变成 1.95 美元。如果你想要更高的实测吞吐量和更快的首 token 延迟,如果你的推理必须运行在 Goo​gle Cloud 上,又或者有明确日期的退役承诺对采购很重要,它同样是首选。它在综合指数和编码智能体指数上与 GPT-6 Astra 持平,并且在 Humanity's Last Exam、GDPval 和 CursorBench 上拥有更强的厂商自报依据——在这些基准上,Open​AI 并未公布可比数字,所以应将其视为证据上的缺口,而非已被证实的胜出。

而一个对比页面在说真话时欠你的答案是:对许多团队而言,诚实的建议是两者都不选。Anthropic 自己关于 Claude Fable 5.1 的文档说,对大多数工作负载,你应该从 Claude Opus 5 开始,只有当你在更高投入下对 Opus 5 的评估仍不达标时,才转向 Fable 5.1。Claude Opus 5 是输入 $5.00、输出 $25.00——在这两项上都是这两款模型各自价格的一半。如果四倍缓存读取优势或三倍 token 效率描述的并不是你的工作负载,那么旗舰溢价买到的就是你尚未证实自己需要的能力,而弄清这一点最便宜的办法,就是在做出承诺之前,用一个密钥把一项真实任务同时跑过这两款以及再低一档的模型。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新