生成的标题卡上写着"GPT-6 vs Claude Fable 5.1",一个标签显示"两者均为每百万输入 $10.00 / 输出 $50.00",另一个标签显示"AA Coding:Fable 5.1 81.6 vs GPT-6 Astra 76.9",页脚写着"指数数据来自 Artificial Analysis;费率卡来自各厂商页面。"OrcaRouter 的 logo 合成在右下角。
Guides & Insights

GPT-6 与 Claude Fable 5.1:费率卡对得上,编程榜单对不上

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 和 Claude Fable 5.1标出的费率完全相同:每百万输入 token 10.00 美元,每百万输出 50.00 美元。这就是简单部分的全部内容。这两个名字并非同一类事物——GPT-6 是一个由三个模型组成的家族,背后没有 gpt-6 端点,而 Claude Fable 5.1 是一个可称量的模型,只有一张费率表——所以,在你确定由 GPT-6 家族中的哪个成员来作答之前,价格相同几乎说明不了什么。在对这个分组最重要的排行榜上,Fable 5.1 位列第一,而没有任何 GPT-6 模型排在第一。

哪个 GPT-6 会出现在这个对比中?

先从命名说起,因为它决定了答案。OpenAI 将 GPT-6 这一代作为三个独立的模型 ID 推出:GPT-6 Astra 位于最顶层,GPT-6 Sol 居中,GPT-6 Luna 位于最底层。并不存在一个可以调用的、名为 GPT-6 的模型。在任何网关上请求 openai/gpt-6,你得到的会是 404,而不是补全结果。

三者中只有一个承载着与 Claude Fable 5.1 相匹配的 $10.00 / $50.00 价目卡,那就是 Astra。Sol 的价格是它的五分之一,为 $2.00 / $10.00,而 Luna 则是它的百分之一,为 $0.10 / $0.50。因此,如果你坚持要按同类费率卡进行比较,“GPT-6 vs Claude Fable 5.1”实际上就是“GPT-6 Astra vs Claude Fable 5.1”——而那个特定的对决如今已不再是令人感兴趣的那个了,原因直到九月底才出现。

Anthropic 这一方则没有这种模糊性。Claude Fable 5.1 是单一模型,于 2026 年 9 月 1 日发布,上下文窗口为 1,000,000 个 token,输出上限为 128,000 个 token,并支持文本、图像和文件输入。它通过模型 ID anthropic/claude-fable-5.1 提供服务。为“Fable 5.1”报价不会有歧义,而为“GPT-6”报价则从来不会如此。

Fable 5.1 实际领先在哪里,以及领先多少

决定这一比较的差距不在通用指数,而在编程榜。该榜单数据读取自 Artificial Analysis,并载于 2026 年 10 月 8 日 OrcaRouter 目录中各模型的条目:

• AA Coding Index — Claude Fable 5.1 81.6,在该榜单的模型中排名第1;GPT-6 Astra 76.9,排名第4
• AA Intelligence Index — Claude Fable 5.1 53.4,排名第8;GPT-6 Astra 52.7,排名第9
• GPQA Diamond — Claude Fable 5.1 93.7 对比 GPT-6 Astra 96.1
• Humanity's Last Exam — Claude Fable 5.1 59.1 对比 GPT-6 Astra 54.7
• SciCode — Claude Fable 5.1 63.1 对比 GPT-6 Astra 56.5
• Terminal-Bench v2.1 — Claude Fable 5.1 91.4 对比 GPT-6 Astra 88.4
• Terminal-Bench v4.0 — Claude Fable 5.1 52.0 对比 GPT-6 Astra 59.1
• 长上下文召回 — Claude Fable 5.1 85.3 对比 GPT-6 Astra 80.7
• 上下文与输出 — Fable 5.1 的输入为 1,000,000 个 token,而 Astra 为 1,050,000 个;两者的输出均为 128,000 个 token

这个格局并不是"某一个模型更好"。Fable 5.1 拿下对应写作与长跨度软件工作的两个榜单——SciCode 和 Terminal-Bench 2.1——而 Astra 则赢得 Terminal-Bench 4.0 和 GPQA Diamond。Fable 5.1 在 Humanity's Last Exam 上领先 4.4 分,在长上下文召回上领先 4.6 分。在综合指数上,两者相差 0.7 分,这落在基准刷新所预期的噪声范围之内。

本文中每一个跨模型数字都适用一条注意事项,这一点值得明说而非埋没:Artificial Analysis并不保证两个模型页面在同一天是基于同一索引版本渲染的,而且它现在还会拆分同类组——开放权重模型与同一规模级别的开放权重模型进行比较排名,专有模型则与某一专有价格区间内的模型进行比较排名。从一个页面读到的分数和从另一个页面读到的分数只是指示性的,并非受控测量。上述两个数字都来自同一个评估器,但请将子分数差异视为方向性而非精确性。

9月29日出现的并发症

如果你在一个月前给这个对比定价,你会派出 Astra,接受 4.7 分的编码差距,并为此支付 $10.00 / $50.00。如今这已不再是显而易见的选择,因为 GPT-6.1 Sol已经存在——它于 2026 年 9 月 29 日发布,比 Astra 晚三周,比该系列其余成员晚一周。

GPT-6.1 Sol 在同一个 Artificial Analysis 智能指数上得分为51.8,而 Astra 为 52.7;其标价为 $2.00 / $10.00——仅为 Astra 价目表的五分之一。它也并非编程榜单的领跑者;它继承了与 Astra 相差一分的那副样子,而非缩小与 Fable 5.1 的差距。但它改变了这一决策的经济账。如果你当初伸手去够一个输出价 $50 的模型,理由是“我需要在困难任务上获得前沿推理能力”,那么 GPT-6.1 Sol 现在以十分之一的输出成本就能回应其中大部分需求。如果理由具体是“我需要房间里最好的编程指数”,那么两款 GPT-6 模型都无法回应,而诚实的建议是继续用 Fable 5.1。

值得明确说明:OpenAI 从未发布过 GPT-6 Astra 与 Claude Fable 5.1 相互对标的比较,Anthropic 也没有发布过 Fable-5.1 与 GPT-6 的对比。本文中的每一个跨厂商数字,要么来自独立评估方的数据,要么来自某家厂商对自家模型所做的基准测试。这里没有任何内容来自两方中任一方开展的正面对比测试。

账单,而非标价

相同的费率卡不会产生相同的发票,因为它们底层的计量表并不相同。

• 缓存输入,Fable 5.1 — 在 OrcaRouter 列表上每百万 $0.25,相当于输入费率的 97.5% 折扣
• 缓存输入,GPT-6 Astra — 每百万 $1.00,90% 折扣
• 缓存写入 — Fable 5.1 每百万 $12.50,GPT-6 Astra 每百万 $12.50,完全持平
• 超过 272,000 输入 token — Astra 会将整个请求重新计价为 $20.00 输入 / $75.00 输出;Fable 5.1 在目录所载的数字上没有对应的档位
• 流量,过去 7 天 — Fable 5.1 173 万 token;GPT-6 Astra 7620 万 token
• 首个 token 的中位时间 — Fable 5.1 4,055 ms;GPT-6 Astra 3,500 ms
• 中位输出速度 — Fable 5.1 每秒 90.1 token;GPT-6 Astra 每秒 70.4 token

在 Fable 5.1 形态的工作负载上,真正影响成本的是缓存这一项。一次长时间的智能体运行,如果二十次重复发送相同的 200,000 token 代码仓库上下文,缓存部分每百万 token 只需支付 $0.25,而不是 $10.00——比 Astra 的 $1.00 缓存读取便宜一个数量级。对于这种形态的请求,看上去一模一样的标价卡其实完全不同,而 Fable 5.1 的编码优势还带来了一种更便宜的使用方式。

272K 这一档对 Astra 来说恰恰相反。任何跨过它的请求都会从第一个 token 开始重新计价,因此在 Astra 上,一个 300,000 token 的提示词会按整个请求以 $00.00 / $75.00 计费,而不只是对超出这条线的 28,000 个 token 计费。在经济型模型上,这一档不过是舍入误差;但在 $10.00 的输入价格下,它就是 $3.00 请求和 $6.00 请求之间的差别。

在不预先选定胜者的情况下同时运行两者

这个对比的实用版本是:你很可能两者都想要,并且希望能够按请求、而不是按季度,在它们之间切换。Claude Fable 5.1 和每一个线上可用的 GPT-6 模型都位于同一个 OrcaRouter 目录中——以一个 API 统一对接 200+ 个模型,供应商的标价以 0% 加价直接透传,因此供应商调价当天就会在这里生效,而不是等到你下一张发票——并且路由 DSL 让你可以按请求大小或按比例拆分流量。适合这对组合的方案是按大小拆分:把简短的、偏编码类请求发给 Claude Fable 5.1,并将那些会触发 Astra 272K 阶梯的长上下文工作路由到费率表中没有阶梯的模型,然后扩大你自己的评测更看好的那部分流量。

跨提供商的自动故障转移是这件事的另一半。这两个模型都无法避免状态不佳的时候,而一条在运行中途性能下降的路由,也绝不是你希望从客户投诉中才发现的问题。

A generated two-column comparison scoreboard titled "GPT-6 Astra vs Claude Fable 5.1 — the scoreboard". The left column, GPT-6 Astra, reads Input $10.00, Output $50.00, AA Intelligence 52.7, AA Coding 76.9, Context 1,050,000, Cached input $1.00. The right column, Claude Fable 5.1, reads Input $10.00, Output $50.00, AA Intelligence 53.4, AA Coding 81.6, Context 1,000,000, Cached input $0.25. A footer line reads "Index figures per Artificial Analysis; rate cards per each vendor page, read 8 Oct 2026." The OrcaRouter logo is composited in the bottom-right corner.

每一侧的用途,各用一行说明

Claude Fable 5.1 是独立榜单上最好的编码模型,定价属于高端档位,却拥有这一价位区间内所有模型中最便宜的缓存读取价格。GPT-6 系列中没有哪个成员能在编码上胜过它,而与该模型共享同一价目表的系列成员——Astra——如今反倒成了你最不可能选择的那一个,因为 GPT-6.1 Sol 的指数得分与 Astra 仅相差不到一分,价格却只有后者的五分之一。

所以,“GPT-6 对比 Claude Fable 5”的答案,完全取决于你指的是哪个 GPT-6。如果你指的是该系列的旗舰,Fable 5.1 在编程榜上胜出,但在每次回答的价格上输给低一档的模型。如果你指的是整个系列,那么在这组对比中,OpenAI 这边目前性价比最高的是 GPT-6.1 Sol,价格为 $2 / $10 —— 而且它仍然不是编程领域的领先者。价目表对得上。榜单对不上。

Screenshot of the OrcaRouter model page for anthropic/claude-fable-5.1, showing the Anthropic vendor label, a 2026-09-01 catalogue release date, a 1,000,000-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $10.00 per million input, $50.00 per million output, a 4.05 s median time to first token, a 10.00 s p95, and 1.7M tokens routed in seven days.Screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the OpenAI vendor label, a 2026-09-04 catalogue release date, a 1,050,000-token context window (shown as ctx 1M tokens), a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, a 'Best for reasoning, coding, agentic' tag row, and a rate strip reading $10.00 per million input, $50.00 per million output, a 3.50 s median time to first token, a 10.00 s p95, and 76.2M tokens routed in seven days.

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新