
Grok 4.5 对决 GPT-6 Astra:标价六倍,账单三倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Grok 4.5 和 GPT-6 Astra 按各自的费率卡并排放在一起,差距看起来荒谬:每百万输入 token 2.00 美元对 10.00 美元,每百万输出 6.00 美元对 50.00 美元。再把同样这两个模型放进 Artificial Analysis 的 Intelligence Index 跑一遍,差距就缩小到团队真能争论一番的程度——每完成一项任务 1.04 美元对 3.26 美元。标价倍数是输入 5 倍、输出 8.3 倍。按真实 token 数衡量的账单倍数则是略高于 3 倍。而这两个模型差异最大的维度,并不在上述两者之中。而是等待首个 token 的时间,独立测得为 10.94 秒对 342.30 秒。
这就是整场对决的一段话概括,也正是为什么这一页不是任何一方的加冕典礼。GPT-6 Astra 是明显更智能的模型,优势清晰且可复现。Grok 4.5 是更便宜的那个,优势确实存在,但比它的价目表所暗示的要小得多。其余的一切——速度、token 效率、上下文、编码基准——要么各有胜负,要么打成平手,要么结果发现是用两把不同的尺子量出来的。
这两个都不是新模型
值得直说,因为很多对比文章读起来,仿佛这两者都是上周才刚出现的。
xAI 于 2026 年 7 月 8 日发布了 Grok 4.5。它基于 1.5 万亿参数的 V9 基础模型构建,并与 Cursor 基于开发者会话数据共同训练,而不只是静态代码,这正是其智能体编程声誉的来源。它拥有 500,000 个 token 的上下文窗口。其自家厂商模型列表至今仍将它列入其中,与两个后继型号并列——xAI 此后已发布 Grok 4.6 和 Grok 4.7——所以请把 Grok 4.5 视为 Grok 系列中 $2/$6 这一档,而不是该系列的顶端。
OpenAI 于 2026 年 9 月 3 日发布了 GPT-6 Astra,并在随后几天分阶段推出,它至今仍是 OpenAI 的旗舰模型:100 万 token 的上下文窗口(OrcaRouter 的目录中列出 1,050,000 输入和 128,000 最大输出)、2026 年 4 月 30 日的知识截止日期,并且明确瞄准长周期智能体工作——计算机操作、研究、科学与网络安全任务。按照 OpenAI 自己的说法,这是首个通过其“Critical”网络安全阈值的模型,这也是为什么企业版访问默认关闭,需由管理员启用后才能使用。
两者在各自厂商的 API 上均已全面可用。二者都不是新发布。本周唯一有变动的,是围绕其中一款的那个家族,而这部分放在本文末尾,因为它改变的是推荐结论,而不是对比本身。
费率卡,包括没人报价的那一档
• 输入,短上下文 — Grok 4.5 每 100 万 $2.00 vs GPT-6 Astra 每 100 万 $10.00
• 输出,短上下文 — Grok 4.5 每 100 万 $6.00,对比 GPT-6 Astra 每 100 万 $50.00
• 缓存输入 — Grok 4.5 每 100 万 $0.30,而 GPT-6 Astra 每 100 万 $1.00
• 长上下文输入 — Grok 4.5 每百万 token $4.00,对比 GPT-6 Astra 每百万 token $20.00
• 长上下文输出 — Grok 4.5 每 1M $12.00 对比 GPT-6 Astra 每 1M $75.00
• 上下文窗口 — Grok 4.5 为 500,000 个 token,而 GPT-6 Astra 为 1,000,000 个 token
真正重要的条款,是几乎所有对比页面都不会印出来的那一条。在 Grok 4.5 上,一旦某个请求的提示词达到 200,000 个 token,整个请求都会按更高档位重新计价——xAI 的文档明确写道,它是“请求中的所有 token 均按更高费率计费”,而不只是超过这条线的 token。因此,500,000 个 token 的窗口确实存在,但其中大约较高的 60% 会按双倍计费。OpenAI 为 Astra 提供的定价页面也印着相同的短/长两栏结构,却没有说明其分界点在哪里;所以,当你进行规模化工作时,应把长上下文那一栏视为适用的一栏,并对照自己的账单确认这一界限。

Astra 的数字之上叠加了两个服务层级乘数:Batch 和 Flex 按标准费率的一半运行,Fast 模式则按双倍运行——短上下文下输入 $20.00、输出 $100.00。Grok 4.5 在 xAI 的价目表上没有批量层级;它的调节杠杆是缓存折扣和 2 倍优先处理。
我们自己对这一切的立场刻意做得很无趣:OrcaRouter 以 0% 加价率原样传递供应商的目录价,因此上面两张费率卡无论哪家供应商何时更改,我们这边都会在当天同步生效,缓存的 token 也按供应商的缓存费率而非全价计费。不存在需要对齐的第二个数字。
工作负载的实际花费是多少
标价在这里参考价值不大,因为这两个模型完成同一任务所消耗的 token 数量并不相同。以一个编码智能体任务为例,它包含 120,000 token 的代码仓库上下文和 25,000 token 的回答。在 Grok 4.5 上,这需要 0.24 美元的输入费用和 0.15 美元的输出费用,合计 0.39 美元。在 GPT-6 Astra 上,则是 1.20 美元和 1.25 美元,合计 2.45 美元。相差 6.3 倍。
现在把提示推过长上下文线:输入 300,000 tokens,输出 20,000。Grok 4.5 计费为 $1.20 加 $0.24,即 $1.44。GPT-6 Astra 计费为 $6.00 加 $1.50,即 $7.50。差距缩小到 5.2 倍,因为两家供应商都将输入费率翻倍,而 Astra 的输出倍数在最高档位收窄。
这两者都不是 Artificial Analysis 所衡量的指标,而他们的数字才是更有用的那个。运行完整的 Intelligence Index 时,Grok 4.5 在高强度模式下的平均每完成一项任务成本为 1.04 美元,而 GPT-6 Astra 在最高强度模式下为 3.26 美元。输入价格相差 5 倍,而倍数却降到 3.1 倍,原因在于 token 效率:在整个指数中,Grok 4.5 生成了 7700 万个输出 token,Astra 生成了 6000 万个。Astra 是更简洁的模型,因此它缩小了一部分自己在价格上拉开的差距。如果你一直在预算文档里引用“便宜五倍”,那么发票上出现的数字会是 3 倍。
速度不分伯仲。延迟则不然。
这是一个令我们惊讶的发现,它与便宜模型就是快模型的直觉相悖。
Artificial Analysis 测得 Grok 4.5 的输出速度为每秒 55 个 token,GPT-6 Astra 为每秒 58 个。在同一指数版本上,这是 5% 的差异,而 AA 自己的摘要将两者都描述为慢于平均水平——比较中位数为每秒 74 个 token。如果吞吐量是你的选择标准,这两个模型分不出高下。与其硬造一个赢家,不如直说:在双方以相同方式测量的唯一一个速度数值上,它们持平。
延迟将二者残酷地拉开差距。AA 测得 Grok 4.5 的首个回答 token 时间为 10.94 秒,端到端为 20.01 秒;GPT-6 Astra 则为 342.30 秒,端到端 350.91 秒。这大约是 31 倍,而在同步请求中,这就是转圈等待与喝杯咖啡的差别。
在任何人为这个数字做预算之前,有两点需要坦诚说明。第一,那些是包含推理的数值——AA 的“首个答案 token 的时间”刻意把模型的思考时间计算在内——所以它们描述的是硬核任务,而不是一次聊天对话。第二,它们的努力程度并不匹配:Astra 公布的条目是在最大 effort 下,Grok 4.5 的是在高 effort 下,而 effort 设置恰恰就是能左右这个数字的旋钮。OrcaRouter 自己为 GPT-6 Astra 列出的数据是,在实时流量中,首个 token 的 p50 为 8.31 秒、p95 为 10.00 秒,这是一个完全不同的测量点——真实生产调用中的首个 token,而不是基准任务上的首个答案 token。两者不可比,不应放在同一句话里作比较。

编程基准测试:引用前先核对版本
搜索一下这场对决,你会发现 Grok 4.5 在 Terminal-Bench 2.1 上的 83.3% 被拿来与 GPT-6 Astra 在 Terminal-Bench 4.0 上的 57.9% 对比。这些是顶着同一名称的不同基准测试。它们无法相提并论,而那些把它们并列堆在一起的对比页面什么也说明不了。
两家厂商公布的大多数编码数据都存在这个问题。xAI 为 Grok 4.5 发布的表格报告称,SWE-bench Pro 为 64.7%,Terminal-Bench 2.1 为 83.3%,DeepSWE 1.0 为 62.0%,DeepSWE 1.1 为 53%。OpenAI 为 Astra 发布的表格报告称,Terminal-Bench 4.0 为 57.9%,OSWorld 2.0 为 72.6%,FrontierMath Tier 4 为 97.6%,ARC-AGI-3 为 99.9%。这些都是厂商自行报告的,而且几乎没有一项重叠。
两者真正在同一套评测框架上正面交锋的地方只有一处:Datacurve 的 DeepSWE v1.1,它让每个模型都在相同的 mini-swe-agent 脚手架下运行 113 个原创、无污染的任务。在那里,GPT-6 Astra 得分为 74.1%,每项任务成本约 6.52 美元,而 Grok 4.5 为 53%。这是本页最干净的单项结果,并且以决定性优势偏向 Astra。还有一个专门针对 Grok 4.5 的额外注意事项:在发现此前的代码库泄露进训练数据后,xAI 的 CursorBench 数据被排除在公开比较之外,因此该模型的任何 CursorBench 数字都应视为不可用。
智能体行为与工具调用
两者殊途同归,区别在于架构而非评分。
GPT-6 Astra 面向开发者的功能假定你正在构建一个编排器。它支持异步工具调用,因此等待某个工具不会阻塞模型继续处理其他工作;支持通过 WebSockets 进行任务中途引导,因此正在进行的运行无需重启即可被重定向;并且推理努力程度可在对话中途调整。在 Codex 中,它新增了一种上下文保留机制,可在多个上下文窗口之间保留笔记,同时更早的上下文仍可被搜索。据报道,OpenAI 自己的系统卡指出,该模型比其前代更难监控,这正是应把工具调用日志和系统状态——而非模型的叙述——作为审计证据的理由。
Grok 4.5 的智能体叙事与其说关乎新的原语,不如说关乎它在何处训练。与 Cursor 在真实的多文件编辑和调试会话上共同训练,正是 xAI 将其软件任务上的 token 效率归功于的地方,也是该模型为何会作为编码界面中的默认选项出现,而非通用旗舰模型。函数调用、结构化输出、流式传输和提示缓存均受支持;工具调用遵循 OpenAI 兼容形态,这就是为什么将其接入现有客户端只需更改 base URL。
目前不存在一个让两者在同等投入下同台竞技的共享独立智能体基准测试,因此我们不会在这里硬造出一个赢家。可以说的是,对于长周期任务,Astra 的工具调用接口是两者中更具表达力的;而对于高吞吐量工作,Grok 4.5 的每任务 token 经济性则更具吸引力。
如果选择Grok 4.5
• 你正在运行高吞吐量或高频率的工作,其中单任务成本是决策的主导因素,而 AA 智能指数上的 39 分已达到你的质量门槛。
• 您的提示词低于 200,000 个 token。这正是 Grok 4.5 价格优势最大的区间,长上下文重新定价也永远不会触发。
• 你希望缓存折扣真正发挥作用。每百万缓存输入令牌 0.30 美元,而 Astra 为 1.00 美元,重复前缀工作负载——长系统提示、共享仓库上下文——很快就能降低成本。
• 在高难度任务上,你需要低于一分钟的首 token 延迟,且无法承受数分钟的等待。
选择 GPT-6 Astra,如果
• 任务是产品,而账单与错误答案相比只是舍入误差。曲线这一端的十四个指数点是真实的能力差距,而不是营销上的差距。
• 你确实能在超过 500,000 个 token 的情况下持续工作。Astra 的上下文窗口大约是 Grok 4.5 的两倍,而且两者之中,只有它在达到这一上限时没有附加重新定价条款。
• 需要用到计算机操作、深度研究,或网络安全态势——包括OpenAI关键阈值附带的企业默认关闭控制项。
• 你正在编写编排器代码,它需要异步工具调用和运行中引导,而不是直接的请求-响应式调用。
本周有哪些变动,以及它为何会改变建议
2026年9月22日,OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna,每百万 token 的价格分别为 2.00/10.00 美元和 0.10/0.50 美元,并称这些价格为永久定价,而非促销价。Sol 是面向编码和分析的中端模型,其输入价格约为 Astra 的五分之一。
这对这个具体决策很重要。如果你拿 Grok 4.5 与 GPT-6 Astra 权衡的原因是价格,那么在 OpenAI 这一边,诚实的比较对象已不再是 Astra——Astra 是旗舰,而 Sol 现在占据的正是 Grok 4.5 真正竞争的层级。Grok 4.5 在输出上仍比 Sol 便宜(6.00 美元对 10.00 美元),在输入上则与其持平(各 2.00 美元),因此它并未被取代;但本周之前写下的比较,是在拿一个性价比模型对比一个旗舰,却把结果说成价格故事。
xAI 这边也是如此:xAI 自己的模型列表中,grok-4.6 和 grok-4.7 与 grok-4.5 并列,因此 Grok 4.5 只是这一系列中的一个选项,而非当前的前沿。

这才是支持路由、而非靠挑选的真正论据。在从业者的实战记述中反复出现的双模型栈——把大批量交给便宜模型,把难啃的长尾升级给昂贵模型——本身就是一种路由决策,而且你可以用配置来表达它,而不必重写代码。OrcaRouter 把两个模型放在同一个 API、同一把密钥之后,按服务商目录价零加价透传,支持跨服务商自动故障转移,并提供一套路由 DSL,让你可以把低于阈值的工作交给grok/grok-4.5,并在任务失败或越过规模线时升级到openai/gpt-6-astra。你可以先在一小片流量上试跑那条昂贵的路径,而不必把生产流水线押上去。
简短版本
GPT-6 Astra 是更好的模型。这差距并不小,如果本页假装不是这样,那它就毫无价值——在同一索引修订版上,53 对 39;在两者都参加过的唯一一项编码基准测试中,74.1% 对 53%。
Grok 4.5 是更便宜的那个模型,但按每完成一项任务计算,其优势为 3.1 倍,而不是其价目表所暗示的 5 倍到 8.3 倍,因为 Astra 为达到同样结果消耗的 token 更少。而在唯一一项对两者以相同方式测量的速度数字上,二者持平。
决策不在于哪个模型胜出,而在于对你这套具体工作负载而言,14 分的指标差距是否值大约三倍的费用——以及你发出的每一个请求,答案是否都一样。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
