
Claude Opus 5.5 演示成本 $3 到 $26:如何解读构建的最初几天
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 495 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 186 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
两个数字来自Claude Opus 5.5的第一周,它们描述的是同一个模型,却相差一个数量级。一位构建者报告了一个已完成的交互式镜头实验室——一个可以拖动对焦环、看着发光的焦平面扫过山谷的页面——API 支出达到 $25.66,实际耗时为 1 小时 26 分钟。一份广为流传的发布演示汇总把一段程序化构建的 Blender 城堡动画——配有烟花和湖面倒影——定价为 $13.30 和 35 分钟。一个登上 r/ClaudeAI 首页的帖子说 $3.21。供应商于 2026 年 9 月 22 日发布了 Claude Opus 5.5,价格为每百万输入 token $4、每百万输出 token $20,而这三个数字都没有错。它们衡量的是不同的东西,如果你要依据它们做预算,就需要知道是哪一项。
这个差距不是噪声。它是智能体运行产生与它消耗之间的差异,而过去四天产生了数量惊人的后者,却几乎没有对其作出任何核算。所以,这里是那些演示旁边没人贴出来的算术,然后是这次发布中真正列在价目表上、可以被核查的部分。
25.66 美元实际买到了什么
价格区间中昂贵的那一端是最有用的一端,因为构建者既公布了产物,也公布了账单。
Ryan Sael 的镜头实验室名为《焦平面》(The Plane of Focus),是一个单页交互页面,在一次会话中由一条提示词构建而成。它把一枚相机镜头放到屏幕上,让你拖动对焦环,并向你展示每个摄影师都知道、却几乎无人亲眼见过的东西:现实世界中那张让照片真正变清晰薄片。转动对焦环,薄片随之移动,玻璃镜片在镜筒内前后滑动以说明原因,控制台则报告距离、光圈和清晰区域——页面打开时的设定是 60 厘米、f/2、1.9 厘米景深。把光圈从 f/2 收缩到 f/16,随着光锥收窄,清晰区域随之变宽。爆炸视图把镜片一一分离。整条流程中没有任何图像模型,也没有下载任何素材:每一个元素都由代码绘制并动画化,正因如此,这场关于弥散圆的演示是一场实时模拟,而不是一张示意图。
那是一篇确实很棒的解释性文章,而附在它上面的说法异常精确:一次完成,1小时26分钟,25.66美元的API用量,我读到时页面已在lens.lab.sael.net上线。这个数字是自我报告且无法审计的,但它也是目前流传的唯一一个附带可供相除的会话时长的演示成本。
把费率卡上的账算一遍。按 Claude Opus 5.5 公布的每百万输入 4 美元、每百万输出 20 美元计算,25.66 美元落在 128 万 token 到 640 万 token 之间,具体取决于构成——如果整次运行全是输入,就靠上限;如果全是输出,就靠下限。像这样的智能体式构建处在中间某处,而它更靠近下限的原因是大多数人会跳过的那一项:Claude Opus 5.5 的缓存读取每百万仅 0.20 美元,是输入费率的四十分之一,所以一个长时间会话反复读取同一份不断增长的代码库时,这部分流量几乎不花钱。一千万缓存输入 token 只要 2 美元。输出这一侧才是模型一个半小时里写代码、思考、再重写所累积的地方:按每百万 20 美元算,一百万输出 token 就是 20 美元,而思考 token 也按输出计费。Sael 给出的数字,与一次产出约一百万输出 token、而输入侧庞大、廉价且走缓存的运行相符——这恰恰就是一次无人值守的 86 分钟构建的样子。
接下来有两点。第一,发布日引起关注的标价下调,从 $5/$25 到 $4/$20,是每个 token 20% 的变化,单凭它本身并不会让这次运行变得便宜;缓存读取从 $0.50 降到 $0.20 这一项,才是让 90 分钟循环变得可负担的关键。第二,也是更让人不舒服的一点:$25.66 的报告里没有任何内容能告诉你这次运行是否顺利。一次执行良好的一次性尝试,和一个折腾了一个半小时才成功的会话,最终会产生一模一样的账单。
13.30 美元这个数字经不起它自己的算术推敲。
这个区间的中段之所以有启发意义,原因有所不同。一篇9月23日刊发的发布演示盘点报道了一场正面对决:Claude Opus 5.5 被要求仅凭一个提示词,以程序化方式构建一段十秒的 Blender 动画——城堡、湖面倒影、烟花——与 GPT-6 Astra 比拼,全程没有手动编辑;报道称其用时35分钟、输出199,600个token,花费约13.30美元,相比之下 GPT-6 Astra 用时28分钟、花费约14.50美元。有意思的是token数量,因为它与价格对不上。
199,600 个输出 token 按 Claude Opus 5.5 每百万 20 美元计算是 3.99 美元,而不是 13.30 美元。仅靠输出要达到 13.30 美元,你需要 665,000 个 token。少掉的钱在其他列里:输入每百万 4 美元,五分钟断点的缓存写入每百万 5 美元、一小时每百万 8 美元,以及任何重试。这不是报告中的矛盾——而是报告在诚实说明:token 数量只计一件事,而账单却计四件事;这是发布周成本讨论中最常见的一种混淆。如果你要从已发布的演示中取一个数字,就取美元金额,并把旁边的任何 token 数量当作对这次运行的部分描述。
在便宜的一端,账目核算就更加单薄了。那个报告一次已完成的构建用了 3.21 美元 API 用量的 r/ClaudeAI 帖子,堪称这类内容的典型:一个标题、一段视频,外加没有任何明细拆分。它可能是一次更短的会话、一个更小的产物,或大量缓存输入。这不是可以用来规划预算的东西,而且其中没有一美元是我能核实的。
为什么这些数字中的每一个都是一个下界
这里的失败模式并不是构建者掩饰了什么,而是筛选。流传开来的演示都是成功的那些,由它们为之奏效的人发布,而四次做出损坏页面的尝试,与那一次没有损坏的尝试成本相同。汇编了 Blender 对比的那篇盘点直言不讳地指出了这一点——没人会发布失败案例——而它自己最详细的条目就是一个例证:一个手表品牌网站第一版偏离了要求,用了难以辨认的字体,需要第二版才成为最终被展示的版本。
“One shot”在这个词库里同样在悄悄发挥作用。它描述的是一次会话,而非一次尝试,而一次会话允许包含模型所能生成的尽可能多的自我纠错——在一次 86 分钟的运行中,这个量相当可观。模型在同一个上下文窗口内两次重写自己的代码,是一次会话,也是两次尝试。
因此,对前四天的诚实解读是三个层级的证据,不应将它们平均看待:
• 自报成本加上会话时长——可用于判断数量级,但无法核实。Sael 在 1 小时 26 分钟内花费的 25.66 美元是这一层级中最有力的条目。
• 自报成本加上 token 数量——往往自相矛盾,正如 13.30 美元这一数字所示。
• 一个背后没有任何依据的美元数字——只能说明有人做了点东西,仅此而已。
发布活动中列入费率卡的那部分
剔除演示宣传后,可验证的情况其实很有限。以下所有数字均为 Anthropic 的费率,摘自该公司自己的模型文档及其 2026 年 9 月的公告:
• 输入 — 每百万 token 4 美元。输出 — 每百万 20 美元,其中思考 token 按输出计费,且 Claude Opus 5.5 的自适应思考始终开启,无法关闭。
• 缓存读取 — 每百万 0.20 美元,倍率为 0.05x。缓存写入 — 五分钟档位每百万 5 美元,一小时为每百万 8 美元。批处理 API — 双向均享 50% 折扣,即 2 美元和 10 美元。
• 快速模式 — 每百万输入 8 美元、输出 40 美元,速度最高可达 2.5 倍,Anthropic 仍将其标为研究预览。
• 整体规格 — 100 万 token 上下文,同步输出 128K token,在 Batch API 上配合 beta 标头可达 300K,可靠知识截止日期为 2026 年 6 月,默认 effort 为 medium,而非 Claude Opus 5 默认的 high。
• 可用性 — Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform,并承诺退役时间不早于 2027 年 9 月 22 日。
供应商自己给出的性能声明(已标注为“声明”):Claude Opus 5.5 在大多数工作上表现与 Claude Fable 5.1 相当,运行成本比 Claude Opus 5 低约 40%,生成输出的速度快 30% 以上。这个 40% 是供应商选定的工作负载平均值,不是价目表上的数字,两者不应被当作同一类事实来引用。
独立核查的幅度小于供应商表格,但指向同一方向,且差距更小。Artificial Analysis 在其 Intelligence Index 上给 Claude Opus 5.5 打出 57.6 分,其模型页面所载数据中,它在 Humanity's Last Exam 上为 61.4 分,在 SciCode 上为 66.9 分,在长上下文召回上为 84.7 分。在同一出版物的编程智能体测量中,其报告的是每任务成本而非每令牌成本,数字却朝相反方向变化:在最高努力级别下,每任务成本升至约 13.04 美元,而在同一测试框架中 Claude Opus 5 为 10.79 美元。单价更低的令牌如果模型消耗得更多,并不等于任务更便宜。这正是演示账单所揭示的同一个教训,只不过这次来自第三方。
第二周有何不同做法
如果 $25.66 这个数字就是让你想尝试这件事的那个数字,那么有用的做法不是按 $25.66 来做预算——而是让你自己跑一遍,得出一个你能解释的数字。
明确设置 effort,而不是接受默认值,因为它才是决定每个任务 token 消耗量的旋钮,其影响比模型选择更大,而且该模型上的默认值已从 Claude Opus 5 发生了变化。有意识地缓存稳定的前缀:Claude Opus 5.5 上可缓存提示的最低长度为 512 个 token,比此前的 1,024 有所降低,因此以前从不缓存的短共享前缀现在也能被缓存。为任何长时间运行的任务在 max_tokens 中留出余量,因为思考也计入该预算,并且已无法关闭——Anthropic 自己的迁移指南建议,最高 effort 级别的工作从 64K 起步,再据此调整。并且在运行结束时而非开始时埋点监测:读取每个响应顶层的 model 字段,因为对于其分类器标记的提示,Anthropic 会在同一次调用内重新路由请求,而你发送的模型字符串并不能说明实际作答的是什么。
最后这一点,正是路由器不再只是便利功能的地方。一个在安全防护边界下无人值守运行了一个半小时的构建,回来时可能已经悄悄在较小的模型上完成了某些轮次,而唯一能发现这件事的办法就是去看。Claude Opus 5.5 在 OrcaRouter 上按 Anthropic 自己的标价提供,零加价——供应商费率直接透传,所以厂商调价在公布的同一天就会在这里生效——而这恰恰是路由在这里所做的最无趣的一件事。有意思的是,一个 API 覆盖 200 多个模型把整个实验都放在单个密钥上,于是"在前沿模型上跑,宁可回退也不要失败"就变成了一行配置,而不是第二份合同加一次重写。自动故障转移正是让一个陌生模型可以安全地放到你在意的路径上的原因,而一个你能绕开的拒绝,就是一个不会在第七十分钟终结你这次运行的拒绝。
下一个将移动的数字
Anthropic 表示,Claude Sonnet 5.5 和 Claude Haiku 5.5 会在"未来几周内"跟进,而这将为这些演示中的每一个重新定价,却不改变它们的形态:更低的每 token 费率,对应着一个谁也无法提前预测的 token 数量。让第一周的数字变得无法使用的同一种不确定性,同样会适用于下一代的数字——这正是要现在就养成习惯,而不是等降价再次落地之后才去做的原因。
目前,诚实的总结很短。Claude Opus 5.5 是真实存在的,已全面可用,定价为 $4 和 $20,并带有该产品线迄今为止最便宜的缓存读取价格。它在最初四天里产出的演示令人瞩目,而它们的价格标签只是轶事。如果你想为自己的工作负载得出成本,唯一能读出它的仪器就是你自己的运行——设好上限,事后再看账单。



本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
