
Step 5 Preview 对比 GPT-6 Astra:以十倍输入价格换取九个指数点
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这两款模型相隔十七天发布,定价却仿佛来自不同的星球。Step 5 Preview是 StepFun 于 2026 年 9 月 20 日发布的 600B 参数稀疏混合专家模型,每百万输入 token 收费 1.00 美元,每百万输出 token 收费 2.70 美元。GPT-6 Astra则是该厂商于 2026 年 9 月 3 日发布的旗舰模型,在输入低于 272K token 阈值时,同样单位的收费为 10.00 美元和 50.00 美元——高于该阈值时则为 20.00 美元和 75.00 美元。也就是说,输入价格是前者的十倍,输出价格约为十八倍,而这款模型在独立智能指数(Intelligence Index)上的得分仅高出九分,53 对 44。Astra 是否更优秀,这一点毋庸置疑。但在你的工作负载上,这一差距是否值得每百万输出 token 多花三十美元,才是真正的问题——而答案在读完本文的过程中会两次发生改变。
每个模型的用途
Step 5 Preview 是为智能体工作而打造并销售的:AI 编程、软件工程、专业知识工作、金融。其架构正是为此而调校——总参数 600B,每个 token 约 27B 激活参数,1M token 上下文,支持文本和图像输入,并具备带扩展思考的推理能力。StepFun 跳过了整个 Step 4.x 系列,直接从 Step-3.7-Flash 跨越到 Step 5。
GPT-6 Astra 是 OpenAI 的通用旗舰模型:100 万 token 上下文,最高 128K 输出 token,输入支持文本、图像和文件,输出为文本,知识截止日期为 2026 年 4 月 30 日,并支持推理、编程和智能体工作流。当答案必须准确无误、而 token 账单并非硬性约束时,企业首选的正是这款模型。
• Intelligence Index — Step 5 Preview 44 对比 GPT-6 Astra 53
• 参数 — Step 5 Preview 总计 600B / 激活 27B,对比 GPT-6 Astra 未披露
• 上下文与输出上限——二者的上下文均为 1M token;Astra 列出 1,050,000 token 的窗口和 128K 输出上限,StepFun 未公布输出上限
• 输入模态——文本和图像 vs 文本、图像以及文件
• 输出速度 — Step 5 Preview 每秒 99.8 个 token,对比 GPT-6 Astra 每秒 59.3 个 token
• 每 1M tokens 的价格 — 输入 $1.00 / 输出 $2.70,而输入低于 272K 时为输入 $10.00 / 输出 $50.00,高于该值则升至 $20.00 / $75.00
• 缓存 — Step 5 Preview 95% 折扣,对比 GPT-6 Astra 的 90% 读取折扣,每百万次缓存写入费率为 $12.50
• 每项 Intelligence Index 任务的成本 — Step 5 Preview $0.71 对比 GPT-6 Astra $3.26

发票,逐行来看
Step 5 Preview 的定价统一且低廉:输入 $1.00,输出 $2.70,并享有 95% 的缓存折扣,使缓存输入价格接近每百万 token $0.05。在 7:2:1 的缓存命中、输入与输出配比下——本博客用于 agent 流量的惯例——混合费率落在每百万 token $0.51 附近,而每个 Intelligence Index 任务的成本为 $0.71,在 200 个中排名第 27。需要注意的是冗长问题:该模型在该 Index 上生成了 1.6 亿个输出 token,而中位数为 9200 万,因此原始 token 数量高于标价所暗示的水平。
GPT-6 Astra 的定价采用分档制,而分档才是值得仔细阅读的部分。每请求输入 token 低于 272K 时,价格为 $10.00 和 $50.00;高于该阈值时,则为 $20.00 和 $75.00。分档由每个请求自身的输入 token 数量决定,对于一款以 1M token 上下文为卖点的模型来说,这一点的重要性远超其字面听起来的样子——单次大上下文调用就会越过分界线,并使整个请求的费率翻倍。缓存读取为每百万 $1.00,即 90% 折扣,缓存写入为每百万 $12.50。在同样的 7:2:1 配比下,混合费率接近每百万 token $7.70,而每个 Index 任务的成本为 $3.26,在 200 个中排第 71 位。
Astra 在冗长程度上则恰恰相反,在这里它是更简洁的模型:在 Index 上输出 6000 万 token,而 Step 5 Preview 为 1.6 亿,在该指标上位列 200 个模型中的第 27 位。更少的 token 配上更高的单价,以原始倍数所夸大的方式缩小了差距。但它并未消除差距——每任务成本这一数字已经把冗长度、缓存行为和定价一并计算在内,而 3.26 美元对 0.71 美元,仍然是 4.6 倍的差距。
这九个指数点能买到什么
Astra 的头条数字来自 OpenAI 自家、且未被复现:GPQA Diamond 上为 96.1,OSWorld 2.0 上为 72.6%,FrontierMath Tier 4 上为 97.6%,带工具的 Humanity's Last Exam 上为 57.2%,Terminal-Bench 4.0 上约为 57.9%。ARC-AGI-3 那个数字才是需要谨慎对待的——OpenAI 报告称,在其自家的 provider-adapter 测试框架下为 99.9%,而在标准测试框架下为 62.7%,两个框架之间 37 个百分点的摆动,至少同样是在说明测试框架本身的问题,而不只是模型的问题。
Step 5 Preview 公布的数值,在它专为智能体任务而构建的那些任务上处于同一区间,并且带有相同的附带说明:Terminal-Bench 4.0 上为 33.3%,ProgramBench 上为 80.5,DeepSWE v1.1 上为 67.7,StepCodeBench 上为 49.0,全部来自 StepFun,且均未经独立复现。不同的厂商、不同的评测框架、没有共同的运行——这正是为什么独立测得的九个百分点差距,比其中任何一个数字都更有用。
这个差距真实存在,而且并不小。在一个包含 200 个模型的榜单上,53 和 44 分别位列第三和第二十四位;而这种差距体现为任务类别的不同,而非同一任务上分数的差异:Astra 公布的胜绩集中在长时程推理和计算机使用上,而这正是榜单头部拉开差距的地方。如果你的工作负载正落在这些场景,那这九分比账单上的价格更值。
关于 Astra 得分的一个注意事项。Artificial Analysis 会修订 Intelligence Index,而同一模型在不同时间相隔数周采集的快照中的数值会漂移——52.8、53 和 54.7 都出现在同一个月内发布的关于该模型的材料中。当前模型页面上的 53 才是应该使用的数字,任何把较旧的 Astra 快照与当前的 Step 5 Preview 数值并列进行的比较,都是在用两把不同的尺子衡量。

速度和延迟是两回事
在生成速度方面,独立榜单的结论毫无争议:Step 5 Preview 每秒输出 99.8 个 token,而 GPT-6 Astra 为 59.3 个,后者也低于所测模型平均每秒 70 个 token 的水平。在交互式编程循环中,这正是一次即时建议与一次停顿等待之间的差别,而且它会像缓存折扣一样,在整个会话过程中不断累积放大。
延迟是更复杂的问题,单看一个数字会对此产生误导。Astra 在输出之前会先进行推理,因此首个 token 时间和获得可用答案的时间并不是同一种测量,而且公开数据会因是否计入推理而差异很大。在过去七天我们自己的流量中,GPT-6 Astra 的首个 token 时间中位数为 6.72 秒,第 95 百分位数为 10.00 秒——这是调用方通过我们的端点实际体验到的数字。Artificial Analysis 在其自有的测试框架上测得 Step 5 Preview 的首个 token 时间为 2.96 秒,而这两个数字的测量方式并不相同,因此不应相互相减。
缓存不对称性实际上落在哪里
两款模型都对重复前缀给予大幅折扣,同时也都对写入这些前缀收费,而两者在读取上的差异高达20倍。Step 5 Preview 的95%缓存折扣使缓存输入价格接近每百万token 0.05美元。GPT-6 Astra 的缓存读取价格为每百万token 1.00美元——这是在基础费率高出十倍的基础上再打90%折扣——而写入价格为每百万token 12.50美元。
对于一个每一轮都要重新发送相同系统提示和仓库上下文的智能体循环来说,真正会复利式累积的是读取费率,而较便宜模型上更深的折扣,比昂贵模型上更浅的折扣更有价值。在相同的 7:2:1 混合比例下,Astra 的综合成本仍接近每百万 token 7.70 美元,而 Step 5 Preview 为 0.51 美元——这是十五倍的差距,长时间会话不会缩小它,反而会拉大它。
用一个键同时运行两者
GPT-6 Astra 已在 OrcaRouter 上线,接入标识为 openai/gpt-6-astra,按 OpenAI 的目录价计费——272K 阈值以下为每百万 10.00 美元和 50.00 美元,阈值以上为 20.00 美元和 75.00 美元——以零加价原样透传,因此供应商调价当天即在我们这边生效,而无需等到下一个计费周期。我们对该端点自行开展的七天遥测显示,上文所引的首 token 延迟中位数为 6.72 秒、95 百分位为 10.00 秒,同时上周经由该端点的流量为 2.779 亿 token。
Step 5 Preview 不在我们的目录中,我们也不对它进行路由。它运行在 StepFun 自家的 API 和 Studio 上,在 10 月 15 日的检查点落地之前,那是它唯一能运行的地方。这种不对称并不是这项对比的缺陷;它本身就是这项对比。这场较量中便宜的那一半,是你必须去别处才能调用的那一半,而你今天就能投入生产的那一半,则坐落在一个覆盖 200 多个模型的 API 之后:按上述价格的 GPT-6 Astra、定价 $1.26 和 $3.96 的 GLM-5.3、DeepSeek V4 Pro、Claude Opus 5 以及其他模型,配合跨提供商自动故障转移,在某家提供商容量变动时保持路径稳定,路由 DSL 则让任务以低成本起步,只在必要时才升级。这条升级规则才是应对十倍价差的真正答案:大部分工作负载并不需要榜单顶端的模型,而路由层正是让你不再为那部分不需要的负载付费的方式。

谁应该选择哪个
如果你的工作负载是一个长周期智能体,必须把一项艰巨任务做对——计算机使用、多步骤研究、错误答案的代价高于 token 成本的工作——那么 GPT-6 Astra 领先九个百分点只是这个决策中最便宜的一环,而账单才是这项能力真正的成本。把它作为升级目标来运行,而不是默认选项,并留意 272K 阈值:单个超大请求会让其中所有内容的费率翻倍。
如果你的工作负载是高吞吐量的智能体文本——代码生成、重构、结构化抽取、编程助手的内层循环——那么 Step 5 Preview 在账单和时钟所关心的一切方面都处于领先,而一旦面对的任务分布并非位居榜单顶端,那九个指数点的优势恐怕难以幸存。问题不在于性能:该模型是专有的,没有公开许可证,没有商业使用授权,在 10 月 15 日之前也没有检查点。你可以调用它;但你无法拥有它、微调它,或发布它的衍生品。
如果答案并不显而易见,那么这里适用的模式是分层拆分,而非二选一。把一般流量路由到中端模型,把 Astra 留给那些需要顶配性能的请求——这条规则的两端在我们这边共用同一把密钥,因此拆分的代价只是一条路由规则,而不是第二份合同。为中端模型就能正确完成的工作支付旗舰级费率,才是这项比较真正要指出的错误。
